大多数长期记忆系统做的事情,是在对话发生的当下就把内容改写成事实、图谱或者结构化记忆——等于边写边替未来的自己做了判断。一篇 9 月底挂在 arXiv 上的工作 Mnemon 反其道而行:它把记忆这件事拆成「快思考」和「慢思考」两套系统,并且坚持一个原则——写入时不做任何决定,所有判断都留到读取时再做。
这个想法的来源很直接:长期记忆要处理的,是一份助手已经读不回头的对话历史。常见做法是把它在写入时就压成事实或图谱,好处是读取快,坏处是「什么重要」这件事在落笔那一刻就被定死了。Mnemon 的提案是,记忆工作其实也像人类思维那样分两套——绝大多数工作属于 System 1:一大堆彼此独立、关于某条记录「还需不需要、是否已经过时」的小判断,由一个叫 Jev 的决策模型一口气做几十条,耗时只有三分之一秒;真正需要 System 2 的只是少数:写几条搜索查询、点明这次回答到底需要什么、再把答案拼出来,这部分交给大语言模型,做得好但慢。原始对话被当成带日期的记录原样保存,后台再跑一次性的合并,把每条记录整理成主题时间线、数值历史和常驻指令,挂回原始记录上。
关键在于,因为写入时什么都没决定,同一个 agent 可以读取任何「返回带日期记录」的存储。这听上去是个工程细节,实际是这套设计最值钱的地方:它让记忆层和具体的存储、具体的模型解耦。你今天把记录存在 A 家,明天换到 B 家,读取逻辑不变。这种可移植性,正好戳在那些写入时就强绑某种结构的系统痛点上。
效果数字来自一篇单人预印本,需要带着合理的怀疑去读。作者 Guangren Wang 报告,用 gpt-4.1-mini 作答、在公开复评的 14 个系统里,Mnemon 在长程对话记忆基准 LoCoMo 上拿到 91.7%,高于其余被复评的 13 个系统,LongMemEval-S 为 83.8%,每题上下文压到 4k token 以下,成本指数也是这组里最低;换成推理模型作答,LoCoMo 到 92.2%、LongMemEval-S 到 94.4%,与已发表的最好结果持平。更耐人寻味的是规模化:在 BEAM 上把历史从 10 万 token 拉到 1000 万 token,单题成本只涨 1.11 倍,而 Jev 区分黄金证据的能力比两个大语言模型更好,速度还快 3 到 11 倍。
放到近一年的记忆研究谱系里看,Mnemon 的签名不是「又省了一点 token」,而是把「双系统」这个心理学框架真的接到了记忆操作上,并且用「写入时零决定」换来了可移植性。它和已经成稿的 Mem++(写入时不蒸馏、读取时再选)、AutoCompact(把压缩训进权重)是同一道大题下的不同解法;差异在于,Mnemon 明确地把大量判断交给一个轻量决策模型,而不是大语言模型,再用后台一次性合并兜底长程话题。这种「用便宜模型做绝大多数记忆判断」的分工,对成本敏感的生产环境可能比单纯堆检索更现实。
当然要泼点冷水。这篇工作仍是预印本,作者单一,基准和对比集都还有讨论空间;「原始记录不动」听起来优雅,但当记录规模到千万级、跨库读取时,后台合并的质量和延迟是否扛得住,公开材料还没给出足够证据。它真正值得行业记住的,是一个被反复验证过的直觉:记忆系统的瓶颈往往不在「记不记得住」,而在「什么时候、由谁来决定什么重要」——把这个决定从写入时挪到读取时,并交给更便宜的模型,是一条被低估的路线。代码已开源在 Grivn/mnemon-memory-agent,后续是否能经独立复现,仍要看社区能不能跑出同样的数字。
对做 agent 的团队来说,Mnemon 给的提醒是:如果你的记忆层在写入时就强绑了某种结构,那么换模型、换存储都会变成重写级的工作。把「决定什么重要」这一环后置,并用轻量模型承担绝大多数判断,也许比继续追逐更强的蒸馏更划算。至于它能不能在真实长程场景里稳住,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。