长期记忆是 2026 年智能体圈子里被反复提起、却很少真正跑通的模块。多数方案的做法出奇地一致:智能体每跑完一轮,就把轨迹压成一段摘要存起来,下次需要时整段调出来。这套写时压缩的逻辑听起来省事,问题在于——你永远不知道未来的任务会用到哪一句细节,于是在压缩的那一刻,可能被后来需要的线索就丢了。9 月 25 日提交的论文 EngramRAG(arXiv 2609.32049)走了一条相反的路:它把记忆的整理从写时推迟到读时,并借生物学的互补学习系统思路,给智能体装了一套清醒时反射、睡觉时归档的双状态回路。
三类记忆病症,三个对症处方
论文先把现有记忆架构的毛病归成三类,这个归类本身就值得做智能体的人抄下来当检查清单。一类叫联想失明:记忆图是扁平的,多跳关系走不动,要找「A 和 C 之间隔了 B」这种间接关联时,检索直接抓瞎。一类叫脚手架失忆:时间衰减一刀切,把用户长期稳定的人设与偏好也一起冲掉了。还有一类叫静态拓扑停滞:记忆图建好就不动,不管哪些实体被频繁访问、应该被推成枢纽。
EngramRAG 给每个病症配了一剂药。针对联想失明,它用使用量调节的个性化 PageRank(U-PPR),让转移概率随访问频率按赫布式可塑性演化,把持久实体自然推成高中心性的枢纽;针对脚手架失忆,它用随拓扑承重权重缩放留存半衰期的巩固机制(CATD),而不是按墙钟时间衰减,并设了一个冷启动宽限期;针对静态拓扑停滞,它用一张 SUPERSEDES 有向无环图来抑制过期状态。三剂药合起来,在受控的突变测试里把分裂脑幻觉从 70% 压到了 0——这件事对做可靠智能体的人来说,比任何跑分都更实用。
结果亮眼,但边界也要说清
在 LoCoMo 这套十个长对话、近两千个问答对的基准上,EngramRAG 的 Recall@5 做到 53.21%,对比稠密向量检索的 38.29%,相对提升 38.9%;时间推理的 Recall@5 到了 62.33%;九十天仿真里脚手架留存维持 100%,而前台检索反射控制在 26.21 毫秒。检索融合上它把稠密向量、BM25 和 U-PPR 三源按动态倒数排名融合归并,算是在经典 RAG 之外补了一层可解释的图信号。
冷静的部分不能省。其一,它目前只在 LoCoMo 这类对话记忆基准上验证,跨到工具调用、长程任务执行这类真正吃记忆的场景,效果还是未知数;其二,双状态回路里后台巩固要消耗额外算力,论文没有给出清晰的成本账,而成本恰恰是长期记忆能不能上生产的关键;其三,它是一篇研究方法,不是某个厂商的已上线产品,距离工程化还隔着文档、SDK 与运维那一套。对智能体赛道的观察者来说,这篇论文真正值得带走的,不是某个指标,而是「把巩固搬进空闲时段异步做」这个工程范式——它暗示长期记忆会像缓存一样,成为智能体运行时的一层独立基础设施,而不是塞在提示词里的一段压缩文本。
对工程团队的启发可以更具体。其一,记忆不该只在任务结束那一刻被压缩,而该在日常空闲时被异步整理,这样既能保留细节、又不拖累前台推理;其二,长期记忆要把哪些信息被反复用到当成一等信号,用访问频率去塑造记忆图的中心性,而不是平铺所有片段;其三,过期状态要有显式的抑制机制,否则同一智能体的多次记忆会互相打架、自己说服自己。这三点合起来,恰恰是把记忆从提示词技巧升级成可观测、可治理模块的起点。