多智能体系统要成事,先得把任务拆给谁、谁和谁协作、怎么把结果拼回来。可自动编排(让模型自己决定怎么搭一个 MAS)一直有两个老毛病:规划被绑死在固定的工人池上,导致换一批工人就得重训;功劳被混成一个终点分数,说不清是「拆得好」还是「配得好」。10 月 6 日挂上 arXiv 的 DeOrch(编号 2610.07556,作者 Xinle Wu 与 Yao Lu)想做的,正是把这两件事拆开——先在不看具体工人的情况下把任务拆好,再用一个与工人身份无关的匹配器去选协作方式。

现有自动编排的两个病根

先说规划绑死工人。多数自动编排方法在训练时,把「怎么拆任务」和「用哪几个固定工人」揉在一起学,终端分数也是整次任务的好坏。结果是一套编排只认得训练时见过的那支队伍,换一批能力不同、接口不同的工人,就得重新训练。再说功劳混成一团。一次任务成了,你不知道是拆得巧,还是某个工人恰好顶用;失败了,你也说不清该改规划还是改协作。这种「单点反馈」让系统化改进无从下手,只能整体调参、碰运气。DeOrch 的针对性设计,就是分别从结构上解开这两道绑。

传统编排绑死工人,解耦编排换队不重训传统自动编排规划绑死固定工人换队伍要重训DeOrch 解耦规划不看工人匹配器在线适配工人池换了,规划器与匹配器无需重训即可套用
图 1|传统自动编排把任务规划与固定工人池绑在一起,换一支队伍往往要重训;DeOrch 让规划阶段完全不看工人身份,再由匹配器在线适配,换工人池不用重训规划器

两段式:先拆任务,再选协作

DeOrch 的规划器分两步。头一步是工人无关的分解:它先把任务拆成子任务、排好结构,这一步完全不携带任何具体工人信息,等于在「还不知道谁来干」的情况下先把活儿想清楚。第二步才进入协作选择:用一个轻量匹配器,基于工人池给的一组紧凑、不含工人身份的可匹配反馈,决定子任务之间怎么协作、调用谁。匹配器本身从一个固定探针集上的行为来估计工人适配度,并用一个情境化 bandit 在线适应,新工人进来不用重训规划器或匹配器。论文报告,它在多个分布内与分布外任务上优于先前的自动 MAS 编排方法,且比同类学习型编排用更少的工人调用;更关键的是,它能直接套到一支完全没见过的工人池上,无需重训。

单一终点分 vs 条件信用分配单一终点分好坏只能混着算不知谁出的力条件信用分配拆好 配好分开算知道改进落点把「拆得好」与「配得好」分开计分,才知道下一步该改规划还是改匹配
图 2|传统做法用一个终点分数把整次任务的好坏混着算,说不清是哪个环节立功或拖后腿;DeOrch 的条件信用分配把「任务拆得好」与「协作配得好」分开计分,改进落点更清楚

条件信用分配:拆好与配好分开算

第二道绑——功劳混成一团——DeOrch 用条件信用分配来解。它把「任务分解得对不对」和「协作配得好不好」分开计分,于是改进有了明确落点:如果分解得分低,就去调规划器;如果协作得分低,就去调匹配器。这和那种只用单一终点分数反推整条链路的做法不同,后者你永远不知道该动哪一块。值得注意的是,DeOrch 的「解耦」并不等于「两个模块完全无关」——分解阶段虽不看工人,但协作阶段会把工人的真实表现回灌给匹配器,形成在线适应;它解的是「训练时绑死」,不是「运行时互不通信」。消融实验也给出方向性结论:两个组件各自都带来一致增益,去掉哪一个都会掉点。

它和 WorkflowOps、FloWright 的区别

多智能体编排近期不缺新工作,得把 DeOrch 放进去看差异化。我们此前覆盖过 WorkflowOps(从历史事件里学协作先验、按需扩工人池)、FloWright(把工作流本身当训练 harness,让角色自演化共演化)、以及做在线自演化图编排的 EvoSteer(用轨迹锚定做信用分配)。DeOrch 和它们的不同在于重心:WorkflowOps 赌的是「历史协作频率可复用」,FloWright 赌的是「角色随工作流一起演化」,EvoSteer 赌的是「经验沿图扩展替代参数扩展」;而 DeOrch 赌的是「规划与工人身份解耦后,编排能零重训地迁移到新队伍,且功劳可分开归因」。换句话说,前几家在解决「怎么让协作更聪明」,DeOrch 额外解决「换队伍还要不要重训、改哪块才知道」。它验证的是论文设定下的多类任务,换到工业界那种工人接口极不统一、目标更模糊的场景,匹配器的探针集是否还够用,仍要等更宽的落地检验。

一句话收尾:DeOrch 把多智能体编排里的「规划绑死工人」和「功劳混成一团」两道老绑一起解开,换队伍不必重训、改哪里也终于说得清。