多智能体系统的成绩,常常被当成一个总分来比。但总分里混着模型差异、通信模式、角色分工与算力成本,谁真正贡献了性能,往往说不清。不少团队选型时只看排行榜总分,结果上线后发现同样的配置在自己数据上并不灵,问题就出在归因缺失。9 月 18 日提交的预印本 OpenMAS-GCom(arXiv 2609.21527)想用受控实验,把这笔糊涂账算清楚——不是再训一个更强的系统,而是给现有系统做一套可归因的诊断。

图增强多智能体为什么更难评

图增强多智能体(G-MAS)通过通信图与角色分工,让大语言模型智能体协同:谁和谁交换信息、各自承担什么职责,决定了系统的行为。但跨系统的最终分数对比,把模型、通信模式、角色与算力预算全都搅在一起,性能差异究竟来自哪一部分,很难分离。换句话说,两个系统分数不同,可能是因为模型更强,也可能只是通信结构更合理,单看总分无法分辨。

把系统表示成可拆的单元

论文的核心做法,是先把一个系统拆成四部分:协作单元、通信连线、共享的中间信息、以及执行规则。在此基础上做受控干预——重连通信边、移除专家或评论智能体、用错误内容替换中间消息、在运行中禁用工人智能体。关键在于:任务、模型、提示词与预算上限全部固定,每次只动一个组件。这样性能的变化就能精确归到被改动的那一项结构上。

专家 Agent评论 Agent工人 Agent共享中间信息执行规则图增强多智能体(G-MAS)协作单元沟通图(谁连谁)+ 角色分工 + 共享信息 + 执行规则,共同决定性能
图 1|把系统拆成协作单元、沟通连线、共享信息与执行规则四部分,才能分离变量。

在 17 种配置上做消融

基准在 17 个配置上展开评测,覆盖单智能体、普通多智能体与图增强三类,横跨 29 个数据集与 6 个领域。此外还构造了 400 个 G-MAS-Complex 任务,要求智能体合并来自多个文档的信息、化解相互冲突的记录,并返回带源标识的指定值。这些任务刻意逼近真实协作里「信息分散且彼此打架」的场景。

重连通信边rewire edges移除专家remove specialist注入错误消息wrong messages禁用 workerdisable workers四种受控干预:每次只动一个组件
图 2|固定任务/模型/提示/预算,只改一项,把性能变化归到具体结构。

放到工程现场意味着什么

对真正在搭多智能体系统的人,这套方法的价值不在名次,而在排查思路。假设一条协作链路突然退化,传统做法是对着总分猜:是模型换了吗、是提示词改了吗。换成受控归因的视角,工程师会先固定模型与预算,再逐一重连通信边、抽掉某个角色、注入异常消息,观察哪一处改动让指标明显回撤。定位到的不是「系统变差了」这种模糊结论,而是「某个具体的通信结构或角色是性能支柱」——这才能指导下一步去改拓扑还是调分工,而不是盲目加模型或堆预算。

几个反直觉的发现

实验给出一些不直观的结论:移除专家智能体带来的平均性能损失,大于移除评论智能体;而「注入错误消息」与「禁用工人」虽然原始分数相近,退化方式却完全不同;在 G-MAS-Complex 上,拿到最高准确率的配置,和拿到最高每 token 准确率的配置并不是同一个。这说明「谁在贡献性能」与「跑得贵不贵」是两件事,排行榜总分把二者混为一谈。

承接本站此前的讨论

本站此前在「多智能体省成本神话破灭」一文中指出,不少被报告出来的效率增益其实来自实验设定而非结构本身。OpenMAS-GCom 把问题往前推了一层:不再纠结「多智能体是否一定更优」,而是追问「究竟是哪一部分通信结构带来了增益」。对实际做系统的工程师而言,启示很清楚——别再盲信排行榜总分,去测你自己的通信拓扑与角色分工,用受控消融替代整体对比。

它的边界

这套基准也有局限:400 个复杂任务规模仍有限;受控干预偏合成,离真实部署的噪声还有距离;底层仍依赖既有模型。但它是方法论层面的贡献,价值在于评测范式——把「多智能体到底强在哪」变成一个可以被实验分离的问题,而不是一句含糊的结论。