长周期对话里的记忆,大多数系统现在还是「被动仓库」:对话一来,按一套固定启发式把内容归档,之后要用时再按相似度捞出来。这种做法的问题是,存什么、怎么存是写死的,并不会因为你后来发现某段对话很有价值就回头调整。9 月 15 日提交的一篇论文提出 ICML 框架,想把记忆机制从「被动归档」变成「可学习的策略」——由智能体自己决定记什么、什么时候取。

Planner 与 Trigger 两个智能体协同

ICML 把记忆拆成两个角色。一个是 Planner 智能体,负责在对话进行中判断「哪些信息值得存」,有选择地编码高价值内容;另一个是 Trigger 智能体,负责在需要回应时动态决定「现在该取哪段记忆」来优化回答质量。两者不是各干各的,而是通过持续的交互反馈共同进化:Planner 存得好,Trigger 取到的就准;Trigger 取到的准,Planner 得到的奖励信号也更正。

增量认知:过去记忆优化的重点是「存得下、取得到」,这篇把重点挪到了「存得值不值、取得到不到位」,并用两个智能体在线博弈的方式让这套策略自己长出来,而不是靠人工拍一套规则。

静态归档 vs 可学习策略旧:对话进来就存旧:存完即忘、不再调新:Planner 筛价值新:Trigger 动态取两智能体经延迟奖励协同进化从「被动仓库」变成「会随交互变聪明的策略」
图 1|旧范式把对话原样归档就不再管;新框架让 Planner 与 Trigger 两个智能体通过延迟奖励持续协同,记忆策略本身在变。

这种协同和单智能体的「边聊边存」有本质区别:单智能体只能在同一时间步内做局部判断,而 Planner 与 Trigger 的分工让「存储决策」和「使用决策」可以各自专精,再通过共同目标绑在一起。

延迟奖励让存储对齐用户预期

这里有个巧妙的设计:奖励是延迟给的。一段记忆被存下来,当时并不知道它好不好;要等后续几轮对话、看回答质量如何,再把「好或不好」的反馈沿时间线回传给早先的存储决策。于是「该记什么」会随着用户预期持续对齐,而不是一次性启发式定死。

延迟奖励把未来反馈回传给存储决策早先存了什么后续回复质量未来反馈虚线:未来反馈反向修正早先的存储取舍于是「该记什么」随用户预期持续对齐,而非一次性启发式
图 2|后续回复的好坏作为延迟奖励,回传给早先的存储决策,记忆策略因此跟着用户预期走而不是写死。

作者用一个会话合成流水线先生成专家数据,让系统在未见过的场景里也能快速做测试期适配。实验表明,相比强基线,这套框架在长周期对话上明显更优,而且有一个此前少见的特点:交互积累得越多,回答质量越能持续往上走,而不是停在某个平台期。

冷启动与现实意义

任何在线学习框架都绕不开冷启动。ICML 用合成专家数据补齐了最初几步的反馈缺口,避免系统一上来因为没样本就乱存。对产品侧的启发是:如果你在做长期陪伴型或助手型智能体,记忆不该只是数据库里多一张表,而是一套会随用户变聪明的策略。把「记什么」交给可学习的 Planner/Trigger,比维护一打手写规则更经得起交互量增长。

边界提醒:延迟奖励依赖一个前提——后续对话确实能反映早先存储的质量。若用户的真实反馈很稀疏、很嘈杂,回传信号就会失真,策略可能被带偏。上线这类机制时,反馈通道的质量往往比模型结构更决定成败。

把记忆从静态归档升级为可学习策略,是长周期智能体里一条值得跟的线。它和同期不少「图记忆」「分层记忆」的工作形成互补:那些解决记忆长什么样,ICML 解决记忆该怎么被学会。