多智能体系统的隐性税

多智能体系统跑复杂任务时,真正吃 token 的往往不是推理本身,而是编排。选哪个任务、分给哪个角色、消息怎么路由、上下文怎么管——这些「有界协调决策」过去也常丢给大模型去做。交互一多,token 与延迟就跟着暴涨,放到真实 Web 服务里很难摊薄成本。S1-MAS 这篇 10 月 6 日挂出的论文(arXiv 2610.08155)想回答一个朴素问题:协调能不能从昂贵的推理里拆出来?

它把协调交给轻量模型

核心做法是「System One 引导的计算分工」。S1-MAS 让一个轻量的 System One 控制器承担那些有界的协调决策:它挑选检查条件、决定下一个任务、判断是否终止;再配一个紧凑的读取器(compact reader),从授权来源取回与决策相关的证据。真正的开放推理,则留给能力更强的 LLM worker。被选中的任务会动态决定 worker 的角色与可访问的源,形成一个「决策—证据」环。

换句话说,强模型只做它擅长的事——想;分工这件事交给一个便宜得多的轻量模型。两者通过环互相咬合,而不是让大模型一边想一边还要操心「下一步派谁」。

数字挺能打

在七个不同基准上,对比 AgentVerse、DyLAN、SelfOrg 等主流多智能体框架,S1-MAS 把 GPT-4o 的 token 消耗降低了 44.9% 到 97.2%,端到端延迟下降 37.8% 到 93.0%,同时精度没有掉。幅度差异很大,说明省多少高度依赖任务结构:越是协调频繁、检索密集的场景,收益越明显。

该怎么读这件事

它解决的不是「agent 更聪明」,而是「agent 更便宜地协作」。适用面集中在信息检索、推理类 Web 服务——这类场景协调动作多、单次推理并不重。局限也清楚:整套方案依赖轻量模型本身的质量,一旦协调逻辑变得很绕,该上强模型还是得上。它的价值在于把「分工」从默认烧大模型,变成可以单独优化的工程旋钮。

和已覆盖的效率工作怎么放

近几轮我们写过 DeOrch(解耦式编排)、DeLM(通信拓扑)、SquidAgent(并行前提判据),它们都在省多智能体的开销,但动手的层不同:DeOrch 动「规划是否绑死工人」,DeLM 动「通信拓扑」,SquidAgent 动「该不该并行」的前提。S1-MAS 动的是更底层的一刀——把「协调」这件事本身从强模型身上卸下来。三篇可以并行读,拼出一个共识:多智能体的成本,正在从「模型多聪明」转移到「怎么分工才不浪费」。

S1-MAS · 把协调外包给轻量模型技术 · 多智能体用户查询复杂信息任务System One 控制器轻量模型做有界协调选检查条件 / 定下一任务判终止 / 做路由compact reader 取证据LLM 推理 Worker开放推理留给强模型按决策-证据环承担真实推理工作角色与源访问动态定7 个基准对比 AgentVerse / DyLAN / SelfOrg:GPT-4o token 降 44.9%–97.2%,端到端延迟降 37.8%–93.0%,精度不降前提:协调与推理解耦,轻量模型只管分工,强模型只管思考
图 1|协调是有界决策,不必烧大模型;S1-MAS 让轻量控制器与紧凑读取器承担分工,强模型只做推理。