多智能体系统的常见做法是「设计期编排」:在动手前就把工作流、角色与通信协议固定下来,运行时照章执行。但人类科学家做研究时,往往会在进行中临时协调分工——谁擅长哪块、谁补哪块,边做边调。arXiv 10 月 1 日提交的新稿《Can AI Scientists Coordinate at Runtime?》(编号 2610.00980)问的正是这个问题:AI 科学家能否也在运行时自行协调?论文提出的 Runtime Agent Coordination(RAC),把「动态组队」从人类科学家的本能,变成了可评估的工程机制。

背景:从固定工作流到运行时协调

当下的 AI-scientist 系统(如 Agent Laboratory、EvoScientist、ARK)大多沿用设计期编排:角色与流程在启动前就定好。这种方式稳定、可复现,但也有明显短板——它假设任务结构在事先就看得清,而真实科研往往中途才暴露该谁来补哪一块。人类研究者的做法恰恰相反:在运行中根据进展重新分配工作、调整分工。RAC 想填补的,正是这道「运行时协调」的空缺。

四种累积条件的均值走向(单种子探索)native 执行60基线运行时通信72+通信运行时选择92最高均值+ 契约与验证80均值回落(依赖主机)运行时选择对每个主机都给出最高均值;再加机制未必总增益
图 1|在 Agent Laboratory、EvoScientist、ARK 三套主机上的 ResearchClawBench 单种子探索里,四种累积条件(原生执行 → 运行时通信 → 运行时选择 → 再加契约与验证)中,运行时选择对每个主机都给出最高均值,但叠加契约与验证后均值回落,且结果依赖主机。

方法:执行期选 agent、给契约、做验证

RAC 的做法是在执行过程中,从既有的 AI-scientist 主机中选择合适的 agent,为它分配一份带作用域的工作契约,并基于产物做验证。验证信息会驱动后续 agent,但不阻塞状态转移,也不丢弃中间产物——这点很关键,因为它保留了并行探索的灵活度,又避免了「为了协调而拖慢一切」。这种「边跑边选、选完即验」的闭环,比事先写死流程更贴合真实科研里的不确定性。论文在 ResearchClawBench 上做了单种子探索评估,跨越 Agent Laboratory、EvoScientist 与 ARK 三套主机,且保持各主机的模型、工具与权限不变,只在预算上做主机级别的校准。

结果:运行时选择有效,但加机制未必总增益

评估设置了四种累积条件:原生执行、运行时通信、运行时选择、以及在前者基础上再加契约与验证。结论有两层。其一是运行时选择对每个主机都给出了最高的平均得分,说明「在执行中临时选对人」确实有效。其二是叠加契约与验证后,平均得分反而回落,且回落幅度依赖主机——也就是说,协调机制不是加得越多越好,在受限预算下,过度协调可能拖累表现。这一发现把「动态编排优于固定工作流」的笼统论断,落到了有边界的实证上。对构建者而言,这意味着协调粒度本身也是要被优化的对象,而非越多越保险。

RAC:执行期从既有主机选 agent执行中按需选 agent从 AI-scientist 主机里挑分配带作用域契约明确职责边界基于产物的验证不阻塞转移、不丢产物反馈给后续 agent验证结果驱动下一步人类科学家在运行中协调分工,AI 科学家也能——但加协调有预算天花板
图 2|Runtime Agent Coordination(RAC)在执行期从既有 AI-scientist 主机中选择 agent、分配带作用域的工作契约,并做基于产物的验证:验证信息驱动后续 agent,但不阻塞状态转移,也不丢弃中间产物。

意义:把争论落到实证

RAC 的价值,不只是提出一个协调协议,而是把「动态编排 vs 固定工作流」这场长期争论,推进到可以量化比较的阶段。它提醒构建者:运行时选择是有效的杠杆,但协调机制本身有成本,盲目堆叠契约与验证可能适得其反。这与近期另一股共识——「编排本身就是一种需要专门打磨的技能」——方向一致:会协调的 system,比单纯堆更多 agent 更重要。它需要被放进预算与主机差异的语境里读,而非当成放之四海皆准的结论。

结语

AI 科学家能不能在运行时自行协调?这篇论文的回答是:能,而且运行时选择确实带来增益;但协调不是免费的,机制叠加有天花板。对多智能体系统的设计者而言,真正的功课是找到那个「刚好够」的协调粒度,而不是把所有可能的治理层层叠上去。RAC 的实证已经把这一点说得很清楚——协调机制必须放进预算与主机差异的语境里读,而不是当作一把万能钥匙。