长程智能体跑得越久,越像一个管理问题,而不是模型问题。每一步都会冒出新的控制抉择:该接着用哪段半成品、该不该推倒重来、什么时候该停。9 月 29 日提交的论文「Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning」(arXiv 2609.38147,Paras Dahal 等十二位作者)把这层控制显式化了:与其让工人在顺手时随手决定,不如单独分出一个「控制器」,专门负责想清楚下一步做什么。
元推理的架构像一对分工明确的搭档。工人(Worker)做任务级的计算:跑代码、调工具、写片段。控制器(Meta-Reasoner)则汇总这趟运行已经确立了什么、探索下一步选项、在剩余预算内给每个选项估值、再带着从持久记忆里取出的上下文把活派出去。关键在「在决策之间,控制器只带着一份紧凑的进度账,而不是把整段历史重放一遍」——这正是长程任务最怕的内存与时间黑洞。论文的基线横跨了生产级 coding 智能体、研究型 harness,以及一个「直接控制智能体」(同样工人、同样预算,但每步由工人自己临场决定)。结果很能说明问题:在 ProgramBench(用程序重建测长程能力)上,元推理配 GPT-5.5 拿到 71.5%,而 Codex 只有 58.0%;配 Opus 4.8 拿到 67.2%,Claude Code 是 65.5%。在抽象推理、多域长程推理、证明生成等基准上,平均比直接控制高 3.6 到 4.2 分。
最值得玩味的是它和「算力预算」的关系。在最大预算下,带管理器的智能体在全部十二项一对一对比里都赢了没有管理器的同卵版本;把 GPT-5.5 的预算翻三倍,分数从 64.1% 抬到 71.5%,而直接控制版卡在 64% 上下不动。换句话说:更多算力只在「有人替你分配」时才真正转化为能力。这和上一批里 GPT-6.1 Sol 讲的那笔「常驻智能体成本账」是同一枚硬币的两面——你既要把单步成本压下来,也要有个会分配预算的脑子,否则堆算力只是在烧钱。论文也坦言反例:预算很小时,管理开销反而拖后腿,所以它不是万能膏药,而是一个「随任务变长才越划算」的开关。
这个架构直觉正在收敛。同一周还有人提出相近的「长程智能体需要独立管理器」论点,开源社区也冒出 The Pair 这类把「只读导师做规划与校验、执行器写代码跑命令」拆成两个角色、各配不同权限的桌面应用。这说明「把下一步做什么的策略,从干活的工人里抽出来」正在成为长程可靠性的标准打法,而不依赖换一个更强的模型。对工程团队,这是个便宜的实验:不改模型,只改「谁拿着预算」——给长循环加一层控制器,往往比追下一代基座模型来得实在。元推理论文给的,正是这套打法的定量证据。
对正把长程智能体塞进生产系统的团队,元推理的启示朴素却关键:先别急着换更大的模型,先看看「谁拿着预算」。给一个跑几千步的循环加一层控制器、让它只带紧凑进度账去派活,往往比追下一代基座更实在;而这套打法最划算的时段,恰恰是任务足够长、以至于「顺手决定」开始白白浪费算力的时候。它和上一轮 GPT-6.1 Sol 讲的单步降本是一套组合拳——步子更便宜、分配更聪明,长程智能体才真正跑得动、也跑得起。这也解释了为什么近期长程智能体的竞争焦点,正从「谁的模型更强」悄悄转向「谁的分配更聪明」:模型差距在收窄,分配差距却能拉开实打实的分数。