一句话:组织记忆不该在写入时就蒸馏,延到读取时再选可能更准

智能体记忆系统有个主流假设:文档写进记忆的那一刻,就用大模型把它压成事实或摘要,之后回答更快。但 10 月初一篇 arXiv 综述(Mem++)指出,这个假设在「组织记忆」场景里并不成立。组织里的决策由很多人独立写进邮件、工单、会议纪要,修订往往是以「新文档到达」的形式出现,而不是回去改旧文档。如果写时就急着蒸馏,六月那次修订的推理、条件与审批链,很可能就在压缩里丢了。Mem++ 的做法相反:写时不调大模型,原样存每篇文档并附日期作者;回答时再按截止日期过滤、用三路索引排序,把「选哪个版本」留给读取时的回答模型。在 OrgMemBench 上,它总分 57.6,高于头部基线 RAG 的 55.0、也明显高于 A-Mem。

同一份组织记忆,两种架构在「何时做决定」上分叉 写时蒸馏(Mem0/Zep 类) 写入即压缩成事实能答的问题被提前固定旧版推理/审批链易丢适合:对话记忆 读时选择(Mem++) 原样存文档+日期作者回答时再过滤与排序旧版上下文得以保留适合:组织记忆
图 1|写时蒸馏提前固定能答的问题,读时选择把版本取舍留给回答模型。

组织记忆和「对话记忆」是两回事

为什么主流做法会踩坑?因为多数记忆系统是为对话记忆设计的:一个人和智能体聊,后面一句话更新前面一句,覆盖旧事实合情合理。但组织记忆不同——三月定政策、六月修订、九月反转,三份文档往往都留着,因为没人回去删旧的。当有人问「六月那次修订的初衷是什么」,如果文档在写时就被蒸馏成几条事实,六月版的推理、条件与审批轨迹可能早被抹平。Mem++ 的核心判断是:这类问题要的不是「压缩后的结论」,而是「原始上下文还在」。

Mem++ 具体怎么做的

写时它几乎不做事:不调大模型,把每篇文档整篇存好,附上日期和作者。读时才是重头戏——先按「问题截止日期」过滤出当时有效的文档,再用三路索引排序:词典匹配、作者标签、语义向量,三路加权倒数排名融合,并留几个槽位给最近的匹配文档。最终「选哪个版本、谁批准了」由读取时的回答模型决定,系统本身不做推断。消融显示,去掉写时的「 consolidation / fact-extraction 步骤几乎不影响分数,说明 Mem++ 的效果本就不依赖写时的大模型调用;而去掉语义向量这一路,OrgMemBench 掉 35.7 分、LongMemEval_S 掉 76.0 分,是三路里影响最大的一路。

OrgMemBench 上 Mem++ 反超基线,Supersession 类优势明显(示意) 总分57.6Mem++(gpt-4.1-mini)基线 RAG 55.0 Supersession67.7Mem++Mem0 仅 40.8 局限Contradiction类 RAG 反超27-28 分并非全能
图 2|Mem++ 总分与 Supersession 类领先,但 Contradiction 类仍输 RAG,说明有适用边界。

辩证看:它不是万能记忆,适用边界要讲清

Mem++ 不是把 Mem0、Zep、GraphRAG 全推翻。OrgMemBench 上它总分领先,在「谁批准了、取代了什么」这类 Supersession 问题上优势尤其明显(67.7 对 Mem0 的 40.8);但作者自己也报告,在 Contradiction 类问题上,RAG 比它高 27 到 28 分,Justification Chain 类几乎所有方法都低于 23 分。也就是说,读时选择擅长「保留上下文、回答版本类问题」,却不擅长「判断互相矛盾的陈述谁对」。此外,核心评测只建立在 73 个问题的单一合成组织上,作者坦言未来要收更多真实组织记录来验证。把它当成「组织记忆的一种更优默认」更合适,而非所有记忆场景的答案。

增量认知:记忆架构的默认假设,该按场景重选

Mem++ 给智能体记忆赛道补了一记提醒:几乎每个现有系统都默认「写时该结构化」,但这条假设在组织记忆里未必成立。把文档原样留下、把决定推迟到读取时,反而能在「谁批准、取代了什么、当时为何」这类问题上赢过多个系统。对做企业知识智能体的团队,这提示一个务实取舍——与其急着在写入时蒸馏,不如先保住原始上下文,让回答模型在读取时再根据问题挑版本。记忆系统的设计,从来不是越「聪明压缩」越好,而是越「留得住该留的」越好。

结语

组织记忆的难,不在记不住,而在记下了却丢了上下文。Mem++ 用「写时不结构、读时再选择」证明,很多时候不急着蒸馏,反而答得更准。对要把企业文档变成智能体记忆的团队,这值得记一笔:先保住原始,再谈压缩。