一句话:多智能体工作流不必事先写死,DHCG 让结构随执行反馈现场长出来

2026 年 10 月 6 日,arXiv 上线论文 DHCG(Dynamic Construction of Hierarchical Collaboration Graphs,编号 2610.07835),针对的是多智能体系统动态编排这个越来越热的方向。现有方法常常受限于组合受限、依赖错位、规模不灵活,难以在执行过程中适配推理需求。作者把多智能体系统设计重构成一个部分可观测的马尔可夫决策过程,由 Planner、Worker、Generator 三个模块,从零开始、依据查询与不断变化的执行反馈,渐进地搭出一张动态层级协作图。

机制拆解:Planner 搭图,Worker 干活,Generator 收尾

DHCG 的三模块各有分工。Planner 在每一步依据反馈,生成一组彼此有区分又互补的角色,专门贴合当前推理需要,并把相关信息有选择地路由给每个角色;它还能在推理足够时提前收尾这张图,或在需要更多推理时继续扩展。Worker 在各自被分配的角色内执行子任务。Generator 则把已经完成的工作整理成最终结果。关键在于,图的组成和规模都不是预先定好的,而是跟着查询和反馈走——简单任务就少搭几层,复杂任务再现场长出来。论文还引入了动作感知的偏好优化,专门训练 Planner 在搭图时做更有效的决策。

为什么是 POMDP:把结构选择也变成决策

把多智能体系统重构成 POMDP,意义在于把「该用多少 agent、怎么分工」本身,也变成可学习的决策,而不是工程师拍脑袋写死的工作流。过去很多系统为某个基准设计一条固定流水线,换一类查询就失灵;DHCG 让结构随任务生成,更接近真实工作负载里查询难度差异大、任务类型混杂的情况。作者在代码生成、数学推理和领域推理三类基准上做了系统评测:相比单智能体基线平均提升 13.06 分,相比静态和动态的多智能体基线也高出 2.77 到 8.02 分,并且在不同的 Planner 后端和未见的 Worker 模型上都有泛化。

辩证看:搭图成本与提前收尾的判据

需要打折看的地方在于开销与判据。其一,每一步都重新规划角色与路由,带来的计算与延迟成本比固定流水线更高,在实时性或成本敏感的场景里要算清这笔账。其二,所谓「提前收尾」依赖 Planner 自己判断推理是否足够,过早收尾会牺牲质量,过晚则浪费资源,这个判据的可靠性仍是经验性的。其三,论文的增益建立在所选基准之上,真实业务里任务依赖更乱、工具更不可控时,动态搭图会不会反而引入结构噪声,还需实测。关于是否会在超大规模、超长周期任务上稳定,目前公开验证仍有限。

行业含义:多智能体编排,正从静态流水线走向动态构图

把 DHCG 和今年的多智能体研究走向对照,能看到同一条脉络:编排的重点,正从「设计一条固定协作流程」,转向「让系统按任务动态决定谁来干、怎么配合」。无论是动态协作图、查询级工作流生成,还是共享上下文层,都在拆掉「一个基准一套流程」的假设。对做多智能体系统的团队,这类能随反馈生长结构的框架,比写死的流水线更扛得住真实需求的参差。

结语

DHCG 把多智能体设计重构成可随反馈生长的层级协作图,由 Planner、Worker、Generator 从零搭起结构。它的价值不在又一个编排框架,而在于让协作结构本身成为可学习的决策,而不是工程师预先写死。至于动态搭图的成本与提前收尾的判据能否扛住生产,要看更广的实测。

DHCG · 动态层级协作图技术 · 多智能体推理把 MAS 重构成 POMDPPlanner按需生成互补角色路由相关信息Worker在角色内执行子任务Generator从已完成工作产出结果从零渐进建图 · 反馈驱动每一步按反馈生成互补角色、可提前收尾、也可继续扩展配套动作感知偏好优化训练 Planner,使其更会搭图比单智能体基线高 13.06 分,优于动静态基线 2.77–8.02 分(代码/数学/领域推理)
图 1|DHCG 不预设固定工作流,Planner/Worker/Generator 按查询与执行反馈从零搭起层级图。