很多多智能体基准默认一件事:每个 agent 都能看到整个环境。可真实世界里这不成立——物理限制、隐私边界、权限隔离,让每个 agent 往往只摸到环境的一小块。在这个「看不全」的条件下,多智能体到底该怎么组织协作,过去很少被认真测过。10 月 3 日挂出 arXiv 的 MASBench(编号 2610.04672)就是冲着这个缺口去的。

过去很多基准默认 agent 之间共享一块「全局黑板」——谁手上有啥信息,大家一目了然。可这在一道防火墙、一份权限表、一条数据合规要求面前就破了。客服 agent 看不到后台全量订单,医疗 agent 看不到跨科室病历,制造 agent 看不到另一条产线的状态,这些才是真实部署的常态。把这组约束拿掉,评出来的「最优机制」很可能只是实验室里的赢家,一上线就被信息盲区打回原形。

在部分可观测下,把协作机制摆上秤

MASBench 的设计很克制:它把约束直接钉死成「部分可观测」——每个 agent 只见局部信息,而不是上帝视角。在这个前提下,它用三类渐进任务来加压:推理、调度、博弈,难度依次往上走;再拿出三种有代表性的协作机制来比:Protocol(靠协议约定怎么交互)、Memory(靠共享记忆)、Routing(靠路由把任务分给对的 agent)。这样一来,实验不是在比「哪个模型更聪明」,而是在比「哪种协作机制更经得起信息不对称的折腾」。

MASBench:三类渐进任务 × 三种协作机制任务:推理任务:调度任务:博弈机制:Protocol机制:Memory机制:Routing约束部分可观测每人只见局部
图 1|MASBench 在部分可观测约束下组织实验:三类渐进任务(推理、调度、博弈)逐一加压,三种代表机制(协议、记忆、路由)在「每人只见局部」的现实里被逐一测

确定性指标:同时看结果与开销

这篇的实用之处在于它给出的不是模糊观感,而是三组确定性指标。性能分看协作结果到底好不好;通信成本看 agent 之间为了协同多花了多少交互;性价比把前两者合起来,看每单位开销换来了多少收益。很多团队在「用协议、用记忆还是用路由」上是拍脑袋的,MASBench 则在不同模型骨干、不同机制配置下给出实证指引,让「机制选择」变成一件可测的事。其中通信成本这一项,往往戳中多智能体最隐蔽的痛点——agent 之间为对齐而多发的对话,常常是肉眼看不见的开销大头。

性能分协作结果好坏通信成本交互开销多少性价比收益除开销确定性指标同时刻画「协作结果」与「通信开销」,机制选择从此可测
图 2|MASBench 给出三组确定性指标:性能分看协作结果、通信成本看交互开销、性价比把两者合起来,让「用哪种机制组织多智能体」从拍脑袋变成可测

为什么「看不全」才是真考题

这篇的增量认知,是把行业从「理想假设」拉回「现实约束」。全局可见是实验室里的奢侈品,真实部署里每个 agent 都带着信息盲区:客服 agent 看不到后台全量订单,医疗 agent 看不到跨科室病历,工厂 agent 看不到另一条产线的状态。这时候协作机制要解决的,恰恰是「怎么在各自只见局部的情况下,把事做成且不漏关键信息」。MASBench 把这一层显式建模进基准,等于提醒做多智能体系统的人:先想清楚信息不对称怎么治理,再谈编排多花哨。

和本批另两篇是同一波「把多智能体变可测」

把 MASBench 和本批的 ST-Bench、NP-Bench 放一起看,三篇其实在干同一件事的不同切面:ST-Bench 测的是「多智能体在专业数据分析里好在哪(覆盖面)」,NP-Bench 测的是「并行编码 agent 怎么不撞车(调度)」,MASBench 补的是「信息不对称下该用哪种协作机制」。三者合起来,标志着多智能体研究正在从「秀能力」走向「可度量、可选型」。当然,MASBench 目前的三类任务仍是受控设定,博弈与调度里的机制优劣能否直接搬进企业真实工作流,仍需在实践中校验。

对正在搭多智能体系统的团队,MASBench 的价值是一句提醒:别在全局可见的 demo 里选机制,要在「每人只见局部」的真条件下去测——那才是你的 agent 上线后会面对的世界。