一句话:多智能体不必把每一步都记下来
arXiv 2609.00237 这篇 Gated-Memory Routing,瞄准的是多智能体系统一个很实在的浪费:每次决策都去读完整的执行历史,历史越长,成本越胀,而很多被重读的步骤其实是冗余的。论文提出用可学习的「门」来挑着记、挑着取,结果在更省的同时还更准。
作者为 Rakibul Hasan Rajib、Mengxing Zheng 与 Qian Lou,已被 EMNLP 2026 接收,8 月底提交。它解决的,正是当多个 LLM agent 协作时,路由(决定下一步派谁、用什么模型)该基于什么状态来做。
两种路由思路的取舍
最朴素的路由只看原始查询,但查询里没有中间进度与报错,路由无法临场调整。于是另一种做法是把完整执行历史喂给每个后续决策——这一步拿到了上下文,却逼着系统反复处理冗余甚至低价值的步骤,论文称之为「执行历史过载」,直接推高推理成本。
核心矛盾因此很清楚:我们需要一个紧凑、随任务演化的状态,既包含有用进度,又不累积无用上下文。Gated-Memory Routing 的答案是,让每个决策同时依据「查询」和一份「学到的执行记忆」。
写入门与检索门
方法里有两道可学习的门。写入门决定哪些推理步骤值得 commit 进记忆——只留非冗余的;检索门则给每个 agent 在每一步供给一个紧凑、相关的子集,而不是全量历史。每一步还由自适应停止控制器判断:记忆里证据够了,就停。
这样一来,路由、角色选择、主干模型选择、是否停止,都被收进同一个由记忆驱动的过程里。记忆不再是「存了多少」,而是「留下了什么、取出了什么」。
实测结果
在五个推理与代码生成基准上,这套框架平均准确率超过此前最优基线 2.44 分;相对该基线,HumanEval 的推理成本下降约 31.9%。也就是说,它同时拿到了「更准」和「更省」这两个通常此消彼长的指标。
论文给出的工程含义很直接:多智能体协作不必读全历史,「挑着记」比「全记下」更划算。对正在用多 agent 跑长链路的团队,这相当于一个低门槛的优化把手——与其加模型、加角色,不如先把记忆管理做对。
它和「多智能体是否值得」的讨论互补
同一窗口里已有研究质疑「多智能体一定更省」的预设。Gated-Memory Routing 不回答「该不该用多智能体」,而是假设你已经在用,然后帮你把协作的记忆成本压下来。两者合起来,构成一组更清醒的工程视角:多智能体的价值需要受控验证,而一旦决定用,记忆的「记什么、取什么」就是值得认真优化的核心环节。公开代码已开源,便于复现与改造。