常规的推理协议通常会给智能体一个固定、预先选定好的任务,然后看它答得对不对。这种设定有一个盲区:它测不出 Agent 是否会在任务绑定被事件流修改后,依然传播相关的更新、保留未受影响的部分、并重建历史任务的对应关系。一篇 10 月挂出的论文把这个问题正式摆在台面上,称为动态任务路由。

当任务绑定被反复修订

作者研究的核心场景是:事件流不断修订任务的绑定关系,系统必须在每次查询时,先解析出当时有效的文档版本,再去解题。为此,他们把 MMLU、MMLU-Pro、MedMCQA、MATH、GPQA、HumanEval 这六个常用基准,改造成 31119 个动态片段、共 373428 条带时间分类的查询。这个设定直接暴露出一对核心取舍:每次事件后全量重算,浪费已做的工作;毫无防护地复用缓存,又会返回过期的结论。

RIAG:把时间解析和推理分开

论文提出的 RIAG(Revision-Aware Independent Agent Graph),是一个有界的多智能体策略,关键设计是把确定性的时间解析与任务推理解耦。它按不可变的文档标识缓存解,每个新任务起始给两次未暴露的尝试,按需调用审计与修复,对每个文档版本至多使用四次调用。

结果上,同质 RIAG 以每查询 0.62 次调用的代价,拿到 54.24% 的联合路由加回答准确率;作为对比,表现最好的方法要用 18.00 次调用才达到 32.22%。异构 RIAG 在 0.63 次调用下也达到 49.78%。用极少的调用次数换来了明显更高的准确率,说明「先取对版本再解题」这条思路本身是成立的。

增量在哪里:动态一致性

这篇工作的增量,不在记忆容量,也不在编排复杂度,而在于把「任务被改了怎么办」从被默许的前提交成了一个显式的工程问题。它和那些讨论静态记忆、固定编排的稿件关注点不同:RIAG 关心的是版本有效性——当底层文档在变,智能体有没有能力在每次推理前先校准自己手里的依据。

当然边界也要说清。它目前聚焦文档版本这类相对规整的修订,更复杂的任务依赖图仍在研究视野之外;基准改造能否充分代表真实世界的动态,也还需要更多验证。但「按不可变标识缓存、按需失效」这一招,成本低、可复用,值得做多智能体系统的团队借鉴。

事件流修订任务绑定,路由到当时有效的文档版本文档 v1(旧)文档 v2(新)修订事件:绑定迁移RIAG 路由按时间取有效版取舍:每次事件全量重算浪费算力,放任复用则返回过期结论
图|图 4|RIAG 把「任务绑定被事件流修订」显式建模:智能体在每次查询前先解析文档的有效版本,再决定复用缓存还是重算,避免把旧结论喂给新任务。