多智能体系统的老问题,是「人多了反而乱」。多数具身多智能体(也就是带身体、在物理世界里跑的一群 Agent)做法很直接:先摆一个固定的组织形态——比如一个总指挥带若干小兵,或者一群平级节点各自为战——再把任务塞进去。可物理世界的任务千差万别:有的环节能同时开工,有的环节必须等前一个环节出了结果才能动。用一套固定结构去套所有任务,难免要么互相踩踏,要么干等。

把人类组织学搬进多智能体

9 月 10 日提交的预印本 ORCH(Organizing Roles and Coordination Hierarchies)走的不是「堆更多模型」的路,而是借人类组织理论的成熟结论来搭组织。它把任务拆成两类互依关系:pooled 互依——几件事彼此独立、可以并行推进,奔着同一个目标;sequential 互依——件事有前置条件,必须按先后顺序接力。ORCH 据此为每次任务动态生成一个分层组织:能并行的工作放进同一组里并发做,有前置关系的环节排成有序的切换序列。

同一批 Agent,两种组织方式,结果不同 pooled 互依(可并行) A B C 共同目标,互不等待 sequential 互依(有先后) A B C B 依赖 A 的产物,C 依赖 B 有前置关系,必须按序切换 ORCH 按任务结构拼组织,而非把固定架构套到所有任务上
图 1|ORCH 的核心动作,是把人类组织理论里的两种互依关系,变成给具身多智能体动态搭组织的规则。

论文在 25 场野火救援任务上做了验证,覆盖侦察、救援、运输、资源管理、 containment 与 suppression,团队规模放到最多 50 个异构 Agent,底层换了 8 个大语言模型。结果很硬:人工设计的 ORCH 组织,最终得分平均比四种代表性具身多智能体方案高 63.97%,执行效率平均高 74.29%;即使用语言模型自动生成组织,得分也平均提升 43.63%、效率提升 52.53%。而且这些优势在不同任务、不同底层模型上都站得住。

最有意思的结论:规模不垄断能力

论文专门点了 long-horizon 任务里一个反直觉的现象——集体表现并不是模型越大越好,不是单调关系。分层组织让团队能在专业小组内部保持并发活动,同时在任务阶段之间做有序切换。换句话说,决定一群 Agent 能不能把事做成的,往往不是单兵的模型参数,而是「谁和谁一组、谁来等谁」这件事被安排得合不合理。

增量认知:多智能体的瓶颈正在从「模型够不够强」转向「组织搭得对不对」。ORCH 把组织设计从拍脑袋,变成了可由任务结构推导的工程步骤——这对救灾、仓储、工厂巡检这类长时程、多角色的具身场景,是直接可搬的思路。

优势与局限,分开看

优势很清楚:它给出了一套可复用的组织构造法,而且跨模型有效,意味着企业不必为换底座重写整套协作逻辑。局限也得说清:ORCH 的组织来自对任务互依关系的分析,前提是任务能被拆成可描述的环节;纯涌现、难以结构化的协作,它未必帮得上。自动生成组织的那版,提升幅度低于人工设计,说明「让模型自己定架构」目前仍不如人先定原则、再让模型填空。更公允的判断是——这篇论文没有发明新模型,而是把「怎么把一群 Agent 组织好」从玄学推进到了可测量的工程问题。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。