9 月提交的 arXiv 论文 2609.22682(Stanford 与 Together AI)抛出一个朴素的观察:多智能体团队的「怎么配合」,本身就是一种可以从过往协作里学出来的能力,而不该写死成固定的「辩论—投票」流程。他们提出的 SAT(Self-Organizing Agent Team,自组织智能体团队),只用了 15 道数学题作为少量训练样本,就让团队自己复盘出可迁移的协作剧本(见图 1)。

具体做法分三步。先用那 15 道题跑协作,过程中把「谁负责核查、谁负责唱反调、谁在什么时候汇总」这类配合方式显式地记录下来;再把这些配合方式改写成可复用的剧本;最后把剧本冻结,直接迁移到没见过的基准上——跨基准不再重新调参(见图 1 的闭环)。拒绝「辩论—投票」的关键,在于把协作策略本身当成可学习的资产,而不是每次都让模型临时现编。

为什么「辩论—投票」不灵?因为它把所有配合方式压成了一锤定音的多数决,既丢掉了「谁更适合先发言、谁更适合兜底核查」这类角色分工,也丢掉了过程中暴露出的分歧信号。SAT 的做法更像是让团队先攒一本「配合手册」:哪些任务该谁先上、谁负责挑刺、什么时候该停下来汇总,都被显式写下来再冻结。配合方式从「临时起意」变成「可复用资产」,正是这一刀的意义。

15 道数学题 少量训练样本 复盘并改写剧本 谁核查谁、谁唱反调 冻结并迁移 跨基准不改 拒绝「辩论—投票」:协作策略本身被当成可学习的资产 学一次,用到没见过的题上
图 1|团队怎么配合,是从过往协作里「长」出来的

结果对照清晰(见图 2)。在 AIME 2026 上,SAT 由三个模型组成的团队拿到 66.7 的准确率;作为对照,表现最好的单个成员只有 48.8,而「完美路由 oracle」——也就是事先知道每道题该派给谁的理想调度员——也只有 59.0。SAT 比这个理想路由还高出 13.4 个点,说明部分答案不是来自「挑对了人」,而是来自成员之间的交互过程本身:争论、互相纠错、再收敛,这些动态产生了单模型与静态路由都给不出的东西。

把这篇论文放进近期「多智能体协作」的研究谱系里,位置很清楚。此前覆盖过的 Agensh(arXiv 2609.26781)让上千个无编排器的智能体自组织,证明「不指定结构也能涌现秩序」;SAT 补的是另一刀:结构不用人类预先指定,但可以从少量样本里「长」出来并冻结迁移。两条线共同在说一件事——智能体团队的上限,越来越取决于「怎么组织」,而不是「单个模型多强」。

对做产品的团队,这论文还有一层提醒:很多多智能体系统的「智能」其实藏在编排脚本里,而编排脚本往往是人写死的。SAT 证明,当协作策略本身可学习、可迁移,系统上限就不再被那张写死的脚本锁死。换句话说,与其花力气调单个模型的提示词,不如花力气设计一套能记录并复用「团队怎么配合」的机制——前者是局部优化,后者是结构升级。

0 40 80 66.7 48.8 59.0 SAT 三模型队 表现最好的单体成员 完美路由 oracle SAT 超 oracle 路由 13.4 点(AIME 2026),说明部分答案来自交互而非挑选
图 2|组织方式本身就是一种能力

照例留一分冷静:66.7 与 13.4 都是论文自报数字,基准集中在 AIME 一类数学竞赛题,换到开放域或带工具调用的长程任务上能否保持,待社区复现;「少量样本学出剧本」的可迁移边界也取决于任务之间的结构相似度。对工程团队的可操作启示反而直接:如果你在搭多智能体系统,与其反复手调「谁辩论谁投票」,不如先设计一套能记录并复盘协作方式的机制——让团队配合成为可沉淀、可迁移的资产,而不是每次都从零现编。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。对工程团队而言,真正可迁移的启示是:与其反复手调辩论与投票的权重,不如先让系统把「谁适合先发言、谁负责兜底」这类配合方式沉淀下来——协作本身,值得被当成资产来经营。