一句话:多智能体扩队不是越多越好,得看任务属于哪一类
arXiv:2609.31563 用 Steiner 的群体任务分类,把「多智能体随团队变大而变强」这件事重新审视了一遍。结论很泼冷水:团队规模带来的收益,强烈依赖任务结构。在析取任务(只要至少一个成员对就成)上,团队变大确实让「至少一人对」的概率升 5 到 20 点;但在补偿任务(靠平均聚合,如费米估算)上,因为各样本共享同一模型的偏差,团队再大误差也只降约 6%。换句话说,盲目加人,很多时候只是把同样的偏重复一遍。
为什么值得看:Scaling 叙事在团队上也会翻车
大模型圈子里「堆量」的直觉太强,于是很自然地被搬到了多智能体:既然单个模型靠规模涨分,一组模型是不是也该如此?这篇论文把这个问题拆成了「任务结构 × 组合机制」两个轴。它先形式化了一个朴素的设定——独立同分布抽样的智能体,在给定条目下条件独立——然后推导出大团队极限:多数投票收敛到模型的众数答案,平均收敛到模型的逐项偏差。这个推导的杀伤力在于,它说明很多「团队变大没用」的现象,不是工程没调好,而是机制在天花板处就已经注定。对正打算用「多 Agent 会审」「多 Agent 投票」做产品的团队,这是一记该听进去的提醒。
机制拆解:决定上限的是「怎么合」,不是「几个」
论文在 13 个开放权重模型、团队至多 30 个智能体、若干代表性基准上做实证。析取任务那侧,有意思的现象是:至少一人正确的概率确实随规模上升,但「让成员直接答、再简单多数投票」几乎吃不到这潜力——模型本身在平均意义上就准到 0.5 点以内,投票帮不上忙。真正管用的是多轮修订,可增益几乎一个同伴就够,加更多同伴收益迅速递减。补偿任务那侧更冷:费米估算天然适合聚合,但样本间共享的模型偏差占了平方误差的约 87%,于是平均只把误差降约 6%;想靠换同族模型救,能在费米估算上帮点,却在析取任务上超不过最突出的那一个成员。团队 scaling 的有效性,被任务结构与组合方式双双锁死。
实验读数:两条经验教训
两个可操作的结论值得记。其一,不要默认「多 Agent 投票」能提升可靠性——在模型本身已经很准的题上,投票基本是平手;只有在「至少一人对即可」且单成员易错的任务上,扩队才有实质收益,而且要用多轮修订而非一次性投票。其二,补偿型任务别指望堆规模摊平误差,因为偏差是系统性的、跨样本共享的,该做的是换模型家族、补外部证据,而不是加人。论文也诚实标注了边界:结论建立在「条件独立」这一理想化假设上,真实部署里成员往往共享提示词、共享检索、彼此可见,依赖结构一变,极限也会动。关于在非独立同分布、带共享上下文的实际系统里极限如何迁移,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
优势与局限:把直觉变成可算的命题
它的价值在于用任务分类这把老刀,把「多智能体该不该扩队」从口号变成可计算的判断:先问任务是析取还是补偿,再看用什么机制合。局限也明显:其一,Steiner 分类虽经典,但真实企业任务常是析取与补偿混在一起,论文未给出混合任务上的清晰处方;其二,依赖独立采样假设,对如今常见的「共享记忆、共享工具、互相看得见」的多体系统未必直接适用;其三,关于 30 个以上规模、或异质能力混合时的拐点,实证覆盖仍有限。它给的方向很实在:扩队前先想清楚,你要的是「至少一人对」还是「平均更准」。
结语
这篇论文最该被记住的,不是某个具体数字,而是它把「人多力量大」这个被默认搬进多智能体的直觉,重新钉回了任务结构上。当我们在产品里加第二个、第十个 Agent 时,真正该先答的是:这个任务,到底是只要一人对就够,还是要靠平均抹平?答错了,加的人只是在重复同一个偏,而不是在纠正它。