长程网页智能体要在真实网站上连轴转:查信息、点按钮、填表单,一趟任务下来交互历史很容易超过上下文窗口。要让它可靠,得记住事实、记住报错和环境的纠正反馈、记住自己做到哪了。现有做法大致两类:要么用固定大小的「覆盖式」记忆,靠反复重写来腾地方;要么周期性做摘要。可这两类都有同一个坑——关键东西会被悄悄丢掉。尤其当任务跨几十步、跑上十分钟级别,记忆一旦在中间漏掉一条纠正信号,后半程就可能沿着错误前提一路错下去。10 月 5 日挂出 arXiv 的 AMBER(编号 2610.07118)盯的就是这个坑。

覆盖式记忆的隐患:把纠错反馈写没了

作者指出,覆盖式记忆理论上什么都能留,因为它可以覆盖掉任何旧内容;但要做到这点,它得在每一次重写时,把每条该留的事实都「带过」下一版。在稀疏的结果奖励下,这件事很难学会。实践中,它会把轨迹里那些关键信息,尤其是环境给的「刚才这步错了、该这么改」的纠正反馈,给写丢。一旦反馈没了,agent 下一轮就学不会「刚才哪里错」,同样的坑会再踩一遍。这恰好解释了为什么很多长程网页 agent 在后期任务上表现不稳。

两种记忆写法:长程网页任务里谁留得住关键信息覆盖式记忆固定大小反复重写稀疏奖励下难学易删关键反馈只追加记忆自由格式持续写规则保证留存纠错反馈不丢
图 1|AMBER 的对照:覆盖式记忆在稀疏结果奖励下会把轨迹里的关键信息和环境纠正反馈写丢;只追加规则从构造上保住全量,不必学「带过每条事实」

只追加:从构造上保证留得住

AMBER 的全名是 Append-only Memory Bank for Evidence Retention(只追加的证据留存记忆库)。思路朴素但干脆:让智能体在推理、行动的同时,联合学会写自由格式的记忆,而「只追加」这条规则从构造上保证留存——新记忆永远接在后面,不会被后续重写抹掉。这样它就不需要去学「怎么把每条事实带过每次重写」,可以端到端用结果奖励的强化学习来训练,不必依赖大量精标的数据。等于把记忆的可靠性,从「学出来的本事」变成了「规则保证的性质」。

WebArena Lite平均成功率 +4.09 个百分点五次重复解出比例 +4.8 个百分点追平更贵精标监督基线写法比记多少更关键纠正反馈一旦被覆盖agent 就学不会刚才错哪仍守实用 token 预算
图 2|AMBER 在 WebArena Lite 上的三项提升:比覆盖式记忆平均成功高 4.09 个百分点、五次重复跑解出比例高 4.8 个百分点,且追平用更贵精标监督训练的基线

在 WebArena Lite 上的三项提升

实测放在 WebArena Lite 上。相比覆盖式记忆,AMBER 平均成功率高出 4.09 个百分点;在五次重复跑里,能稳定解出的任务比例高出 4.8 个百分点;更关键的是,它追平了一个用更贵精标监督训练的覆盖式基线——也就是说,靠「只追加」这个写法,它用更省的训练成本拿到了差不多的效果,同时还守住了实用的 token 预算。这对长程任务很要紧:记忆不能为了可靠就把上下文撑爆。

记忆这条线,本站最近看得越来越清

把 AMBER 放回近期记忆相关研究里,它的独特贡献是「写法比记多少更关键」。本站此前覆盖过 MemFit(免 LLM 写入、近即时插入、靠多路检索提效),也覆盖过 sno-station(编码 agent 的共享加密记忆加交叉互审)。三者合起来看,记忆正在从「怎么把东西塞进去」走向「怎么写对方式、怎么跨 agent 可信复用」:MemFit 管写入成本,sno-station 管跨 agent 的可信共享,AMBER 管长程轨迹里的反馈不丢。对做网页智能体的团队,这篇的提醒很具体:别只盯记忆容量,先想清楚「纠错反馈被覆盖」这件事——它往往是长程任务后期翻车的隐形元凶。这种从「怎么把东西塞进去」到「怎么写对方式」的转向,正是今年记忆研究里最实在的进展。当然,AMBER 目前只在 WebArena Lite 这类受控环境验证,真实网站的动态变化会不会带来别的丢失模式,仍要等更广的复验。

AMBER 给的启示其实一句话就能说清:记忆的可靠性,很多时候不取决于你记了多少,而取决于你有没有把那条「刚才错了」的反馈,稳稳地留在后面。