一个老问题的重新检验
测试时计算(test-time compute)的常规玩法是并行采样:同一个模型跑 k 份独立输出,然后多数投票,或者有验证器时取 best@k。这套范式有一个隐含假设——各路尝试彼此独立,互不通信。可问题早就有人问过:真实的科研不这么干,一个团队里有人取得突破,整个组都会往前走,为什么智能体不行。此前关于「通信到底有没有用」的实证结果一直互相打架,有说好的,有说没用的。arXiv 2609.21032 号论文(微软研究院实习项目,与 UC Berkeley 合作)把这问题重新做了一遍控制变量实验,结论清晰得罕见。
实验设置刻意简单:k 个智能体,没有预定义角色,不分工,整个协议只有一个共享目录——任何人随时可以把自己取得的进展写进去,也随时可以读到别人的。没有中心协调器,没有消息路由,通信成本就是读写目录。
核心数字:k 个会聊天的顶 4k 个各自为战的
在 ARC-AGI-3 这个需要全新问题求解能力的基准上,结果是 team@k(k 个通信智能体)的成功率与 4k 个独立智能体相当,而且这个优势随 k 增长——团队越大,通信的复利越明显。更有说服力的是这样一类任务:单个智能体无论跑多少次都解不出来,而一个通信团队可以可靠地解决。这不只是效率提升,而是能力边界的移动:某个智能体偶然找到的突破口,通过共享目录变成全队的起点。
增益还迁移到了研究型任务上。在多联骨牌装箱(polyomino packing)任务上,通信团队超过了 best@k,并刷新了此前已知的最好成绩;在 MNIST 分类器压缩任务上,四个智能体的团队产出了一个 1957 字节的分类器,测试精度 99.4%——比已知最好的人类方案和最好的单智能体结果都更小。四个智能体各自探索压缩方向,谁找到更小的结构,全队就在这个基础上继续压。
边界同样清晰:通信不是免费午餐
论文诚实地给出了失效条件:当算力受限时,通信的协调开销会挤占探索预算,独立并行反而更好;当任务缺乏明确的进展度量时,同步变成噪音,团队会被彼此的无效尝试带偏;而当任务本身单智能体就能轻易解决时,通信纯属浪费。三条边界翻译成工程语言就是:共享内存不是加得越多越好,先看任务有没有可度量的进展信号,再看预算够不够同时养活探索与同步。
对多智能体工程的意义
成本侧还有一层账要算。通信的代价不只是 token 开销随智能体数量线性增长,还有目录读写的时序设计:谁在什么阶段写、谁在什么阶段读,论文里靠智能体自主判断,工程化时通常需要更严格的写入规范,否则目录会被低质量进展灌满,通信反而变成污染源。另一个悬而未决的问题是通信内容本身的保密性——共享目录里的中间成果如果涉及敏感数据,团队内部的访问控制要怎么做,论文没有涉及。这些缺口恰恰说明协议的极简是把双刃剑:好处是任何框架都能低成本实现,代价是把工程化的重担留给了落地团队。
对做智能体系统的团队,这篇论文提供了一个比角色分工更轻的协作原语。主流框架里的多智能体协作往往从角色设计开始——规划者、执行者、审查者各司其职,通信拓扑提前画好。而这项工作说明,在开放性任务上,无角色加共享目录的极简协议就能拿到可观收益,且随规模放大。这跟黑板系统(blackboard architecture)的老思想一脉相承,但把验证做到了当下的基准强度。需要提醒的是,结果来自论文自设的实验环境,跨任务迁移的普适性还有待社区复现;通信的 token 成本随智能体数量线性增长,量产环境里这笔账要单独算。目前官方及行业暂未披露更多复现细节,后续将持续跟进迭代动态。