先看它问了什么问题
多智能体拆解的理由通常有三条:上下文更小、职责更清楚、可以并行。这三条都不算错,但它们回答的是「拆开之后每一步是不是更好做」,而不是「拆开之后,最后拿到的结果是不是更多」。
9 月 15 日提交的一篇预印本换了个问法:叶子节点发现的东西,有多大比例真的回到了根节点。作者 Rong He 把多智能体拆解建模成一棵普通的树,然后开始算账。
这个问法之所以值得单独拎出来,是因为它在企业部署里对应一个很具体的预算问题:一个研究任务要不要拆给多个智能体,拆几层,每层几个。多数团队靠直觉回答,这篇论文试图给出一个可计算的形式。
拆解对产出做了什么
模型很简洁:一个被交付 b 个条目的智能体,以概率 r(b) 保住其中任意一条。
先看一个极端情形。如果 r(b) 恰好等于 1 除以 b,那么无论任务规模多大、树长成什么样,每棵树都恰好交付一个发现。作者在 20,000 棵随机生成的不规则树上验证了这个结论,误差到 2.4 乘以 10 的负 15 次方。
这个结果有点反直觉。「每棵树恰好交付一条」意味着拆得再多也只是一个发现——多出来的层没有增加产量,只是把同一份信息从不同路径传递了一遍。
再看一般情形。如果 r(b) 等于 C 乘以 b 的负 δ 次方,那么一棵深度为 k、覆盖 N 个发现的树,交付量是 C 的 k 次方乘以 N 的 1 减 δ 次方。
这个式子的结构比数值更重要:任务规模 N 与架构参数分开了。架构每加一层,只贡献一个不超过 1 的系数 C;而任务规模那一项由指数 δ 决定,无论怎么排布智能体都绕不开它。结论因此很直接——就产出而言,平铺是最优的。
三个参数是在生产轨迹上量出来的
模型只有意思还不够,关键在参数取值。
作者在 600 条生产环境的深度研究轨迹上测得 δ 等于 0.34,置信区间 0.30 到 0.38,而且用了三种互不共享失效模式的识别方法,结果一致。
系数 C 的取值是 0.571,置信区间 0.527 到 0.615。这一处值得单独说:它不是外推出来的,而是在 16,082 个跳点上实测的,其中 b 等于 1(也就是只有一个条目可传)的情形出现了 550 次。有实测锚点的参数,比纯拟合出来的参数可信度高一个档次。
第三个参数与对齐有关。在一份 1,012 条标注过的多智能体轨迹上,每十六份任务说明里有一份跑偏,据此得到 μ 等于 0.939,每层的对齐罚是 C 乘以 μ,也就是 0.536。
把这三个数字连起来看:每加一层,产量先被一个 0.571 的系数打折,再被一个 0.939 的对齐系数打折。层数越多,这两次打折叠加得越厉害。
深度换到了什么
如果结论只是「拆解降低产量」,那这项工作就只完成了一半。作者接着指出,深度确实换到了两样东西。
其一是根上下文的暴露量。根上下文是那个会持续存在、也最难廉价遗忘的状态;深度把它需要承载的条目数从 N 降到 N 的 1 除以 k 次方。这是一个实打实的收益:根节点的上下文压力随深度下降得很快。
其二是成本。生产环境里的平铺智能体按 N 的 1.39 次方计费,而不是「追加式上下文」理论预期的 N 平方。这个斜率比预期平缓得多,说明真实系统已经做了大量压缩与剪裁。而按同一个模型推算,在等花费的条件下,两层结构会在 403 个发现处反超平铺。
把两组结论放在一起,得到的判断就不是「不要拆」,而是「拆的收益要看你在换什么」。如果目标是让根上下文别撑爆,拆是有效的;如果目标是让发现的总量最大化,拆是有代价的。
委派是一个开局动作,不是容量管理
这篇论文里最值得产品团队留意的一段,是关于委派时机的。
作者在一份包含 743,819 次生产工具调用的数据上跑了一个风险模型,结论是:委派行为不对「上下文正在变满」作出响应,它更像是开局就走的一步。
这个发现与很多团队的直觉相反。常见的心智模型是「上下文快满了,就把子任务丢出去」——把委派当作一种容量管理手段。实测数据不支持这个模型。
同时,模型推算出的「值得委派」的会话占比是 0.7% 到 11.3%,而实际委派比例是 7.8%。7.8% 落在这个区间的偏上位置。这个对照说明的不是「系统性过度委派」——7.8% 并没有离谱到区间之外——而是委派决策与任务本身的相关性并不强。
与已有评测的关系
这项工作不是孤立出现的,把它放进近期的多智能体研究里会更清楚。
今年 8 月底发布的 SwarmBench 把评测对象从「单智能体答得对不对」推到「编排过程好不好」,引入了准确率、效率、成本与过程质量这组维度。它回答的是「怎么衡量一次编排」,而这篇论文回答的是「拆解本身对产出上限做了什么」。两者不冲突:一个给过程质量提供了可测口径,一个给产出吞吐给出了上界的形式。
九月中旬那份多智能体对抗压测则指向第三个方向:在长时间运行里,多智能体系统的主要问题往往不是拆解,而是对齐——被污染的信息写进持久记忆之后,系统可能会在几十小时之后才行动。三份工作合起来提示同一件事:多智能体的收益是有条件的,而把条件写具体,比复述「多智能体更强」有用得多。
落地时可以直接用的三条
其一,把委派率当成一个需要监控的指标,而不是越多越好。有了这个数,才能把自己的比例与任务性质对上。
其二,关注每层的对齐损失。任务说明的跑偏率对产量的影响,与保真率在同一个量级上——每层 0.939 这个系数意味着十层之后还会剩下大约一半。多数团队在设计多层结构时只考虑保真率,不考虑说明跑偏,这一层最容易被漏掉。
其三,用两个可测量的量来定深度,而不是用「职责清晰」这类定性理由:根上下文的暴露上限,以及自己的计费斜率。这两件事都可以在自己的系统里测出来。
需要说清楚的局限
其一,这是单一作者的预印本,尚未见到同行评议或独立复现。
其二,δ 与 C 的取值来自特定生产环境与特定 harness 的轨迹。换一套框架、换一类任务分布,取值很可能不同。把它们当作行业常数使用是错的,当作自己测量的起点才是对的。
其三,模型是简化过的:它假设每层的保真行为独立同分布,忽略了任务之间的依赖、工具的具体差异以及上下文内容的区别。这类模型擅长判断方向与量级,不适合预测某个具体项目会丢掉多少。
其四,论文没有做端到端对照实验来证明「按模型建议减少委派就能提高最终质量」。从「模型说只有一部分会话值得委派」到「照做会变好」,中间还差一次验证。
目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。