一句话:多智能体不必把每一步都记下来

arXiv 2609.00237 这篇 Gated-Memory Routing,瞄准的是多智能体系统一个很实在的浪费:每次决策都去读完整的执行历史,历史越长,成本越胀,而很多被重读的步骤其实是冗余的。论文提出用可学习的「门」来挑着记、挑着取,结果在更省的同时还更准。

作者为 Rakibul Hasan Rajib、Mengxing Zheng 与 Qian Lou,已被 EMNLP 2026 接收,8 月底提交。它解决的,正是当多个 LLM agent 协作时,路由(决定下一步派谁、用什么模型)该基于什么状态来做。

两种路由思路的取舍

最朴素的路由只看原始查询,但查询里没有中间进度与报错,路由无法临场调整。于是另一种做法是把完整执行历史喂给每个后续决策——这一步拿到了上下文,却逼着系统反复处理冗余甚至低价值的步骤,论文称之为「执行历史过载」,直接推高推理成本。

核心矛盾因此很清楚:我们需要一个紧凑、随任务演化的状态,既包含有用进度,又不累积无用上下文。Gated-Memory Routing 的答案是,让每个决策同时依据「查询」和一份「学到的执行记忆」。

两种路由记忆的取舍路由看完整执行历史每步都重读此前全部推理历史越长,成本越胀冗余步骤拖慢还费钱称为「执行历史过载」门控记忆只留非冗余推理步骤每步给紧凑相关子集自适应停止控制器收尾成本与精度同时改善路由既看查询,也看「学到的执行记忆」写入门决定记什么,检索门决定取什么,二者都可学习只从查询出发的路由,跟不上中间进度与报错
图 1|把「记什么、取什么」做成可学习门,等于给多智能体装了紧凑的工作记忆。

写入门与检索门

方法里有两道可学习的门。写入门决定哪些推理步骤值得 commit 进记忆——只留非冗余的;检索门则给每个 agent 在每一步供给一个紧凑、相关的子集,而不是全量历史。每一步还由自适应停止控制器判断:记忆里证据够了,就停。

这样一来,路由、角色选择、主干模型选择、是否停止,都被收进同一个由记忆驱动的过程里。记忆不再是「存了多少」,而是「留下了什么、取出了什么」。

实测:更准,也更省+2.44 分 平均准确率−31.9% HumanEval 成本五项基准综合最优在五个推理与代码生成基准上,平均准确率超过此前最优基线 2.44 分相对基线,HumanEval 推理成本下降约 31.9%方法已接收至 EMNLP 2026,代码开源对工程的含义:多智能体不必读全历史,挑着记就行
图 2|「挑着记」比「全记下」更准也更省,给多智能体编排一个具体优化把手。

实测结果

在五个推理与代码生成基准上,这套框架平均准确率超过此前最优基线 2.44 分;相对该基线,HumanEval 的推理成本下降约 31.9%。也就是说,它同时拿到了「更准」和「更省」这两个通常此消彼长的指标。

论文给出的工程含义很直接:多智能体协作不必读全历史,「挑着记」比「全记下」更划算。对正在用多 agent 跑长链路的团队,这相当于一个低门槛的优化把手——与其加模型、加角色,不如先把记忆管理做对。

它和「多智能体是否值得」的讨论互补

同一窗口里已有研究质疑「多智能体一定更省」的预设。Gated-Memory Routing 不回答「该不该用多智能体」,而是假设你已经在用,然后帮你把协作的记忆成本压下来。两者合起来,构成一组更清醒的工程视角:多智能体的价值需要受控验证,而一旦决定用,记忆的「记什么、取什么」就是值得认真优化的核心环节。公开代码已开源,便于复现与改造。