多智能体系统越来越依赖“记忆”:把跑过的轨迹沉淀成可复用的流程知识,下次类似任务直接调用。一篇 10 月 4 日挂出的论文(arXiv 2610.05176)指出,这套做法有个被低估的副作用——记忆会“中毒”,也会“越界”。作者把这套治理思路命名为 AECG(非对称经验整合与治理),核心是把记忆从静态仓库,翻成一条带可靠性的治理闭环。它提醒我们:记忆越多不等于越聪明,反复召回的错误经验,比没有记忆更危险。

两类结构性风险

一类叫记忆污染(memory pollution):那些过时的、证据薄弱的、或者只是“碰巧成功”的流程,一旦被存进记忆并反复召回,就会变成推理里的常客,悄悄拉低后续决策。另一类叫范围坍塌(scope collapse):某条经验在它原本有效的协作范围里好用,却被反复套用到不兼容的决策层级,让局部错误引发一连串下游失误。两者都不是“记错了”这么简单,而是“记对了的边界没守住”。在多智能体里,因为一个 Agent 的 recalled 知识影响了另一个 Agent 的下一步,级联放大的风险比单 Agent 更隐蔽。

静态记忆库弱证据程序反复被召回范围坍塌知识逃出协作边界记忆污染:错的成功经验沉淀成默认范围坍塌:局部对的用法被误用到别处
图 1|两类结构性风险:污染让错误固化,坍塌让局部知识越界误用

把记忆变成可审计的治理环

AECG 的做法不复杂但很克制:先靠多尺度、带置信度的可靠性信号 detect 哪些记忆在退化;再把“退化程度”和“下游影响”合起来,在有限的复核预算下优先处理高风险知识;接着做定向干预,而不是一刀切清空;最后,修正过的技能只有在“配对重放”验证通过后,才重新启用。在三个多智能体框架、四个基准上,它在 12 组框架-基准设置里拿到 11 组最好成绩,比参比记忆方法里表现最好的方案最多高出 10.23 个百分点;而一旦去掉“范围保护”这一项,准确率最多掉 16.89 点——反证了“边界”才是关键。

检测退化按影响排序定向干预配对重放后才复活在有限复核预算下优先高风险知识
图 2|治理闭环:发现退化→按下游影响排序→定向干预→配对重放验证后才重新启用

记忆治理,是工程不是玄学

这篇论文给落地团队的提醒很实在:当你给智能体加记忆时,真正要防的不是“记不住”,而是“记错了还反复用”和“用错了地方”。可行的抓手包括:给每条记忆打协作范围标签、对弱证据程序设衰减、在召回时校验它是否还落在原场景、对影响面大的知识做人工复核闭环。它和近期一批评测上下文精简、过程级监控的研究是同一个方向——智能体的可靠性,越来越不靠“模型更会聊”,而靠把这些经验与状态当成可审计、可回滚的资产来管。多智能体一旦上生产,记忆治理就该和产品本身的测试同等对待,而不是上线后再说。

落到工程侧,AECG 给的启示比“加个记忆”更具体:不要无差别沉淀成功经验。可行的做法是给每条记忆打协作范围标签、对弱证据程序设衰减窗口、在召回时校验它是否还落在原场景、对影响面大的知识走人工复核闭环。记忆的版本化也很关键——哪次改了哪条经验、改完谁验证过,都应可回滚。这听着像软件工程的代码评审,本质也的确是:把“经验”当代码管。它和近期一批评测上下文精简、过程级评测的研究是同一方向:智能体的可靠性,越来越不靠模型“更会聊”,而靠把这些经验与状态当成可审计、可回滚的资产来管。那些把记忆当黑盒、只管往里塞的团队,迟早会在某次级联失误里,为一两条“看似成功”的错误经验买单。而这类失误往往不在日志里显眼,只在某次关键决策出错后才被回溯,那时代价早已发生。记忆治理必须前移,靠范围标签与衰减窗口把错误挡在召回之前,而不是等事故倒逼复盘。把经验当代码管,这句话的真正含义,是给记忆也配一套评审与回滚,这恰恰是很多团队缺的那一环。