陪你很久的对话型智能体,必须记住早先说过的话,才能不让你反复交代背景。可指令和上下文是会变的,记忆系统得既能留当前状态、也能留历史状态,还得分清哪些是过时信息、哪些是活跃知识,并按查询取回对的证据,而不是每次都重新调大模型把历史重写一遍。10 月 6 日挂在 arXiv 的 MINDSET(编号 2610.08586,作者 Sujato Dutta 等四人)给出的判断是:长期记忆更该被当成「受控的状态管理」,而不是没完没了的总结。

不可变片段,再织成带版本的纲要

MINDSET 先把每次对话存成不可变片段,再把片段组织成带版本的纲要。新片段到来时,系统可以强化、取代、拆分或新建一条纲要,而不是把整段历史压缩成一段摘要反复覆盖。这和那种「越聊越长、越总结越糊」的记忆路线很不一样:它把「这次到底发生了什么」作为不可变事实留存,再在上面长出可演化的结构。配合迟滞机制,一个孤立的矛盾不会立刻触发对稳定记忆的重写,避免了「听到一点反例就推倒重来」的抖动。

把对话存成不可变片段,再织成带版本的纲要片段 E1不可变片段 E2不可变片段 E3不可变版本化纲要 S1:强化 / 取代 / 拆分 / 新建
图 1|MINDSET 把每次对话存成不可变片段,再把片段组织成带版本的纲要;新片段到来时可强化、取代、拆分或新建纲要,而不是把整段历史压成一段摘要反复覆盖

最小能量转移与迟滞闸门

把片段织进纲要时,MINDSET 用一个最小能量状态转移来平衡五种代价:表示失真、矛盾、历史损伤、碎片化、内部不一致。直觉是,任何一次「把新片段并入记忆」的动作都有代价,系统要在这些代价之间找一个最小扰动的落点。迟滞闸门则负责兜住噪声:一个孤立的矛盾先不触发改写,等它足够稳定再动。这两件事合起来,让记忆的演化更像受控的状态机,而不是随时可能被一句话带偏的文本流。

最小能量转移 + 迟滞:别为一个矛盾就重写稳定记忆转移代价函数表示失真 矛盾 历史损伤 碎片 自不一致迟滞闸门孤立矛盾先不触发改写在 850 题上答对比 5 个记忆系统高,检索排序显著优于次优方法
图 2|MINDSET 用最小能量状态转移来平衡五种失真代价,再用迟滞阻止孤立矛盾过早改写稳定记忆;在 700 条 LoCoMo 加 150 条 MemoryAgentBench 上取得更高答案与检索排序

为什么不直接让模型把对话越压越短?continual summarization 的坑在于,摘要会悄悄丢掉「这条结论当初为什么成立」的来龙去脉,还会把互相矛盾的片段揉进同一段话,等真要用时才发现记岔了。MINDSET 的不可变片段加版本化纲要,等于把「发生了什么」和「现在该怎么理解它」分开存:前者不许改,后者可以演化。迟滞再兜住噪声,避免一条孤立反例就推倒整张纲要。对一个要长期陪用户的 agent,这种「事实不可变、理解可演化」的分工,比反复重写历史更扛得住时间,也更容易事后说清「为什么当时这么记」。

评测结果

作者在 850 道题上把 MINDSET 与五个记忆系统对比(700 条 LoCoMo 加 150 条 MemoryAgentBench)。MINDSET 拿到最高的 LoCoMo 答案 F1,并在检索排序(Recall@8、MRR、nDCG@8)上显著优于次优方法,霍尔姆校正后 p 值小于 0.01;在 MemoryAgentBench 上也取得最高观测分,只是相对差异不大。消融实验指出,受控的碎片化和纲要感知的归属,是答案质量提升最主要的来源。作者还用 GLM-4.7 与 Gemma-4-31B 做了 700 题的跨模型验证,说明这套方法不挑底座。

记忆该被当成状态管理,不是总结

MINDSET 想传递的观点很明确:当一个智能体要长期陪你,记忆不该被理解成「把对话越压越短」,而该被理解成「把状态管得越来越准」。我们此前覆盖过把记忆写成图、把记忆做成只追加的几种路线,MINDSET 把这条线推到了「版本化纲要加最小能量转移」这一层:记忆的演进被显式建模成状态迁移,而不是隐式地靠摘要去近似。当然,它验证得最充分的是对话与长程问答场景,换到工业界那种结构更松散、证据更嘈杂的任务,版本纲要的构建与维护成本会不会反过来压过收益,仍要等更宽的落地来回答。

对做记忆模块的团队,一个可立即借用的思路是:与其反复总结,不如先分清「哪些是不可变事实、哪些是会变的纲要、哪些矛盾值得触发迟滞」,把记忆当成状态机来设计。