旧基准只数结果,不问过程

九月二十八日提交的 arXiv 论文 MASTraceBench(编号 2609.34496)指向一个被现有评测绕开的问题:当我们说「多智能体协作有效」,到底有效在哪里、又会从哪流失。现有多智能体基准大多盯着最终答案对不对,协作过程是否被改善、被保持还是被毁掉,基本是黑箱。MASTraceBench 的做法是沿着「提案轨迹」去诊断和打分——在六个合作与竞争混合的任务上,它追踪并评估每个智能体的提案是怎么产生、怎么被聚合、又怎么变成最终答案的,并配上一套多层指标:任务得分、协作增益、提案轨迹指标,以及常被忽视的 Token 成本。

Agent A提案 αAgent B提案 βAgent C提案 γ⇒聚合 / 合成追踪每条轨迹谁的贡献被采纳最终答案从哪来⇒最终答案Task ScoreCollaborationGain不只数结果,而是顺藤摸瓜看协作增益从哪来
图 1|MASTraceBench 让多个智能体各自提案,再聚合出最终答案,并逐条追踪提案轨迹,区分「谁贡献了什么」,而不是只看最后一题对不对。

一个反复出现的规律:最终答案很少超过最佳初始提案

论文用这套框架系统对比了几类代表性多智能体方法,发现一个耐人寻味的常态:最终答案很少能超过最佳的那条初始提案。交互往往做的是把较弱的初始提案往上托,靠近那个最佳的;而本来就很强的初始提案,反而很少被进一步推高,甚至可能因为被拉去迁就别人而发生回退。换句话说,很多所谓「协作增益」,实质是 redistributing upward,而不是凭空创造出一个更好的新解。这对企业是个警醒:如果你的多智能体系统只是在做平均、投票或直接采纳,你很可能一边留住了最佳想法,一边又悄悄把它拖下水。

CLEARS:把「整提案交换」换成「声明级评估」

顺着这个发现,论文提出 CLEARS 方法,把智能体之间「整段提案直接交换」改成「声明级评估」——把提案拆成可核验的声明,跨智能体逐条比对后再做可靠合成。这个改动看似细小,效果却明确:CLEARS 更常保住或抬升最佳的初始提案,并在六项任务里有五项取得了最高的协作增益。它的工程含义很直接:多智能体合成不要急着吞下整段对方输出,先问清楚「你这句话里哪几条主张是可核验的」,往往比盲目融合更稳。

整提案交换把 A 的完整提案交给 B 直接采用强提案易被带偏→声明级评估把提案拆成可核验的声明逐条比对合成→CLEARS保住最佳初始提案6 任务占 5 优规律:最终答案很少超过最佳初始提案,协作多在「把弱提案往上托」,而非创造新最优把交换粒度从「整提案」降到「声明」,合成更稳、更强提案更不易被拖垮
图 2|CLEARS 用声明级评估替代整提案交换,在六项任务中有五项取得最高协作增益,更常保住或抬升最佳初始提案。

声明级评估不是银弹:它也要付成本

也要把话说全。CLEARS 把粒度从整提案降到声明,意味着多了「先拆解、再逐条比对」的一步往返,每次合成都要付出额外的模型调用与延迟。在提案本来就短、信息已经干净的简单任务上,这层开销未必能换来等价的增益,反而拖慢节奏。更关键的是,它假设每条声明都能被独立核验——当任务进入权衡类、价值判断类或没有客观标准的领域,可核验性本身就会变弱,声明级比对也就从标尺退化成又一层主观聚合。所以把它当成默认范式去套所有多智能体系统,并不比过去「直接投票」更稳妥;它真正划算的场景,是那些提案长、证据可验证、又容易被互相带偏的复杂协作。

对选型的两个实在提醒

抛开论文本身的指标,MASTraceBench 给实务留下两条可操作的提醒。其一,评估多智能体不能只看交付物,要看过程里有多少无效消耗——一个任务即便成功,也可能有大量动作是冗余、互相抵消甚至添乱的。第二,Token 成本这条指标必须和效果一起看,因为「多加几个 Agent」在不少场景里换来的不是更好,而是更贵且更易回退。当然,论文只在六个任务上验证,声明级评估自己也会带来额外开销,且测试模型有限,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。但它把「协作增益从哪来」量了出来,已经比只报一个总分更有用。

一条被低估的评估转向

把视野拉宽,MASTraceBench 与差不多同期出现的多智能体长程协作、协作记忆边界等基准,共同指向同一件事:多智能体评测正在从「终局比分」转向「过程可解释」。当企业真的把十几个智能体编进一条生产工作流,能解释「谁贡献了什么、哪一环在拖后腿」,比一个漂亮的总分更能决定你敢不敢放它上线。这条转向不会让旧基准立刻失效,但会重写我们给多智能体打分的尺子。