长周期对话里的记忆,大多数系统现在还是「被动仓库」:对话一来,按一套固定启发式把内容归档,之后要用时再按相似度捞出来。这种做法的问题是,存什么、怎么存是写死的,并不会因为你后来发现某段对话很有价值就回头调整。9 月 15 日提交的一篇论文提出 ICML 框架,想把记忆机制从「被动归档」变成「可学习的策略」——由智能体自己决定记什么、什么时候取。
Planner 与 Trigger 两个智能体协同
ICML 把记忆拆成两个角色。一个是 Planner 智能体,负责在对话进行中判断「哪些信息值得存」,有选择地编码高价值内容;另一个是 Trigger 智能体,负责在需要回应时动态决定「现在该取哪段记忆」来优化回答质量。两者不是各干各的,而是通过持续的交互反馈共同进化:Planner 存得好,Trigger 取到的就准;Trigger 取到的准,Planner 得到的奖励信号也更正。
增量认知:过去记忆优化的重点是「存得下、取得到」,这篇把重点挪到了「存得值不值、取得到不到位」,并用两个智能体在线博弈的方式让这套策略自己长出来,而不是靠人工拍一套规则。
这种协同和单智能体的「边聊边存」有本质区别:单智能体只能在同一时间步内做局部判断,而 Planner 与 Trigger 的分工让「存储决策」和「使用决策」可以各自专精,再通过共同目标绑在一起。
延迟奖励让存储对齐用户预期
这里有个巧妙的设计:奖励是延迟给的。一段记忆被存下来,当时并不知道它好不好;要等后续几轮对话、看回答质量如何,再把「好或不好」的反馈沿时间线回传给早先的存储决策。于是「该记什么」会随着用户预期持续对齐,而不是一次性启发式定死。
作者用一个会话合成流水线先生成专家数据,让系统在未见过的场景里也能快速做测试期适配。实验表明,相比强基线,这套框架在长周期对话上明显更优,而且有一个此前少见的特点:交互积累得越多,回答质量越能持续往上走,而不是停在某个平台期。
冷启动与现实意义
任何在线学习框架都绕不开冷启动。ICML 用合成专家数据补齐了最初几步的反馈缺口,避免系统一上来因为没样本就乱存。对产品侧的启发是:如果你在做长期陪伴型或助手型智能体,记忆不该只是数据库里多一张表,而是一套会随用户变聪明的策略。把「记什么」交给可学习的 Planner/Trigger,比维护一打手写规则更经得起交互量增长。
边界提醒:延迟奖励依赖一个前提——后续对话确实能反映早先存储的质量。若用户的真实反馈很稀疏、很嘈杂,回传信号就会失真,策略可能被带偏。上线这类机制时,反馈通道的质量往往比模型结构更决定成败。
把记忆从静态归档升级为可学习策略,是长周期智能体里一条值得跟的线。它和同期不少「图记忆」「分层记忆」的工作形成互补:那些解决记忆长什么样,ICML 解决记忆该怎么被学会。