一句话:多智能体之间与其交换结论,不如交换「该用什么思路去想」
9 月 28 日提交的论文《Self-Adapting Group of Experts for Multi-Agent Reasoning》(arXiv 2609.35412,作者 Mohammad Atif Quamar 等)提出 SAGE,一个无需训练的框架,目标是让多智能体系统根据初始回答,判断哪种推理策略更适合当前问题,再把这套策略迁移给其他智能体。它的特别之处在于:迁移只用各 Agent 原本的系统提示,不接触题目本身,也不接触彼此生成的解答。换句话说,同伴之间共享的是「怎么想」,而不是「想出了什么」。策略适配之后,智能体再通过一张动态的稀疏有向无环图交换信息,把得分高的 Agent 的回答往得分低的 Agent 那里路由。
出发点:多数框架改了上下文,却没改策略
论文观察到,现有的多智能体框架普遍让不同角色的建议、评审、打磨环节各司其职,但往往只通过改写上下文来适配通信,每个 Agent 的系统提示从头到尾固定不变——哪怕手上的题更需要对齐、推理或分解,大家还用同一套打法。作者想验证的是:Agent 们的初始回答,本身能不能暴露「哪种策略更适合这道题」,并据此把这种策略转给别的 Agent。这把问题从「怎么把信息传得更准」,转向了「怎么让每个 Agent 用对方法」。
SAGE 怎么做:用三道判据选 donor,只迁策略不迁答案
SAGE 的迁移机制不碰题目也不碰解答,靠三道判据来选策略 donor:答案是否一致、前缀是否一致、以及互相评审的结果。被选出的 donor 的推理策略,会被迁移到其他 Agent 身上,但各 Agent 原有的角色保持不变——你还是评审,我还是起草,只是「怎么想」被对齐到更合适的那一套。迁移使用的只有每个 Agent 原本的系统提示,这意味着它不需要把题目或草稿在 Agent 之间搬来搬去,信息暴露面更小。策略适配完成后,Agent 之间再通过一张动态、稀疏的有向无环图交换内容,让得分更高的 Agent 把回答路由给得分更低的同伴。
增量认知:同伴能教彼此「怎么想」,而不只是「想出了什么」
这篇论文的增量,在于把多智能体协作的关注点,从「内容交换」挪到了「策略交换」。它和此前我们覆盖过的元推理(控制器—工人分工)、运行时协调(每一步选均值最高的同伴)是同一类问题的不同切法——那些侧重谁来做决策、按什么信号选同伴,SAGE 侧重把「对的推理风格」提前对齐,再让内容顺势流动。它的好处是适配粒度更细:不同题需要的不是不同信息量,而是不同方法论。实验在多个基座与推理基准上相对基线取得更高平均准确率,说明「先对齐思路,再交换内容」这条路径有实际增益。
边界:选错 donor,会把错误思路放大
要诚实标注局限。SAGE 的前提是「初始回答能暴露正确策略」,可一旦某题的初步信号带偏,选出的 donor 本身就是错的,迁移只会把错误思路铺开。它依赖答案一致、前缀一致与互审这三道判据的质量,而这些判据在题目本身含混或 Agent 普遍答偏时,未必可靠。此外,策略迁移与后续路由都假设 Agent 角色边界清晰,对角色高度重叠的系统增益有限。关于 donor 选择的失败模式、对对抗性题目的鲁棒性,以及稀疏 DAG 的构建开销,论文及行业暂未披露更多细节。
结语
SAGE 给多智能体协作补了一块常被忽略的角度:真正该在同伴间流动的,可能不只是彼此的结论,还有各自该用的思路。当分工越来越细,先让一群 Agent 想在同一套方法上,再让内容流动,或许比不断往上下文里塞信息更省力。多智能体要变强,先从「怎么想」对齐开始。