一句话:把「协作」从单智能体的能力里单独剥出来量
2026 年 9 月 25 日提交、已被 COLM 2026 录用的论文 AgentWorld(arXiv:2609.31590)指向一个被现有基准绕开的问题:当多个智能体要长时间一起干活,我们到底有没有办法量出它们是不是在「真协作」,而不只是各自勉强完成。论文作者阵容跨宾大、哥伦比亚等机构,给出一套 100 个人工标注任务加 100 个增强变体的基准,把评测搬进一个内容丰富的 MMORPG 沙箱,让 3 到 20 个角色与能力不对称的智能体在 50 轮以上的交互里,靠通信、联合规划与资源共享去完成目标。关键设定是黑盒:每个智能体独立行动,看不到别人的内部状态。这意味着所谓协作,只能靠可观测的动作与对话去推断。
为什么需要它:老基准量的是对抗、短程或单兵
作者点出的空白很直接。多数多智能体基准要么在竞争环境里比输赢,要么把交互压在 20 步以内的短程,要么干脆把各智能体的个体表现加总,等于默认「个体强就等于团队强」。但真实场景里,长程任务最难的恰恰是分工是否清楚、信息是否在关键节点传到位、计划能否跨轮次保持一致。AgentWorld 刻意把这些条件做重:不对称的角色意味着没有谁掌握全局,长程意味着早期一个误解会被后面几十轮放大。把协作单独拎出来评,才能看出模型之间真正的差距在哪里。
新增的尺子:CCE 不只看成没成,还看努力有没有用
除了常规的二元任务成功率,论文提出 Causal Collaboration Effectiveness(CCE,因果协作有效性)这个基于图的指标。它追踪智能体动作之间的因果依赖,衡量一个团队的努力里,到底有多大比例真正促成了最终结果。这个角度很实用:一个任务即便成功,也可能有大量动作是冗余、互相抵消甚至添乱的;CCE 把「看似忙碌」和「真正贡献」分开。对企业选型有启发:评估多智能体系统,不能只看交付物,还要看过程里有多少无效消耗。
结果:即便表现最好的模型,也只把一半任务真正做成
论文在 Gemini 3 Flash、Claude Haiku 4.5、GPT-5 Mini、DeepSeek R1-70B 四款模型上做了实验,表现最好的模型任务成功率也只有 52.0%。这个数字本身不意外——长程、多角色、黑盒,本来就是当前模型的弱项;值得记的是它把弱项摊开在了可复现的基准上。同时暴露的系统性失败模式很一致:通信断裂(该同步的信息没同步)、角色混淆(谁该负责哪一块说不清)、以及无法在几十轮里维持一份共享计划。换句话说,瓶颈不在单兵能力,而在团队纪律。
失败模式对企业意味着什么
把这几类失败翻译到生产环境,几乎就是今天多智能体落地最常踩的坑:把任务拆给几个智能体后,没人负责把中间结论对齐;一个智能体改了计划,另一个还按旧版本执行;需要跨系统确认的信息,卡在某一环节反复重试。AgentWorld 的价值不在于给出解决方案,而在于把「协作失效」从一句模糊的抱怨,变成可以度量、可以排名、可以对照改进的指标。开源这一选择也让它更容易被拿去当回归测试的标尺。
优势与局限:基准干净,但离生产仍有距离
优势在设定扎实:黑盒、长程、角色不对称,正好对应真实协作里最难的部分;CCE 提供了比成功率更有信息量的维度;全开源也利于复现。局限同样要记:其一,MMORPG 沙箱是受控环境,和企业的异构系统、权限与审计现实不是一回事;其二,100 个任务样本仍偏小,结论的稳健性需要更多任务族验证;其三,四款被测模型未能覆盖当前表现最好的一批,对「上限在哪里」仍需后续补充。关于更多模型的横向对比与更细的失败归因,官方及行业暂未披露更多细节。
结语
AgentWorld 把「多智能体协作」从口号变成可测的对象,是这类基准里少见的、专攻长程与黑盒的一篇。它真正值得跟踪的,不是那 52% 的成功率,而是 CCE 这类指标会不会被企业借去当多智能体系统的日常体检项——毕竟在真实业务里,能看出团队哪里在空转,比知道它偶尔能交付更有用。