长程信息搜索智能体有个恼人特性:早期吃进来的噪声或误导上下文,会一路带下去,等到发现走偏,已经积累太多错误,想回头越来越难。传统做法要么硬扛,要么靠自动压缩把上下文越压越短,但压完往往连关键证据一起没了。
Traverse 给搜索智能体装了一套自我管理的节奏。它定义了三个状态:Rubric 先定「什么算合格答案」,Answer 按这个标准去搜,Verify 在结束前自己核验结果,再决定终止还是继续搜。配合一个叫 Seal Memory 的工具,智能体可以主动收拢或放开上下文,而不是被动等系统压缩。
用强化学习训练这套行为时,作者撞上一个坑:直接训「记忆工具怎么用」会让训练不稳,论文叫它 Seal Collapse——模型学不会该在什么时候调记忆。解药出奇简单:只训上下文管理之后的那一段,让前面的上下文管理先就位,再优化末段的决策,训练就稳住了。
收益落到真实基准上。35B 模型在 BrowseComp 拿到 72.83,并在 BrowseComp-ZH、xbench、DeepSearchQA、WideSearch,以及金融调查、商品搜索等任务上稳定超过基座。消融实验还显示,自主压缩明显优于自动 compaction——智能体自己决定留什么,比规则统一压一遍更靠谱。
「可重置」是 Traverse 里容易被忽略但很关键的一点。多数搜索智能体一旦走偏,会硬着头皮跑完,因为「终止并重来」在训练里很少被奖励。Traverse 把 Verify 放在决策闭环里,验不过就清空上下文换条路,等于给了智能体一个「认错成本很低」的逃生口。真实网页的长尾干扰那么多,有没有这个逃生口,往往决定任务能不能收敛。
和仅做自动压缩的方案比,Traverse 的主动记忆管理更接近人的研究习惯:先列标准,边搜边判断「这段还值不值得留」,跑偏了就推倒重来。Seal Collapse 的坑也提醒我们,这类自我管理的训练并不天然稳定,需要在训练结构上专门处理——否则模型要么不用记忆,要么过度压缩把证据弄丢。Traverse 的价值,是把「搜」和「记」合回同一个智能体手里:它不只回答问题,还管自己搜的过程、管自己该留多少上下文、该在何时清空重来。
再拆一下 Rubric 这个状态为什么关键。多数搜索智能体没有「先定标准」这一步,上来就搜,搜到哪算哪,于是「什么算搜够了」永远模糊,导致要么早停漏了关键证据,要么停不下来反复打转。Traverse 把「合格标准」显式写成一个状态,智能体每一轮都能拿它衡量进度,Verify 才有的可验。这其实是把「研究计划」前置了——和人带研究助理时先对齐「这份报告要回答哪几个问题」是同一回事。
需要补的边界也清楚:BrowseComp 上的 72.83 来自 35B 这一设定,论文的增益是否平滑迁移到更小或更大的模型家族,还要更多证据。Seal Collapse 这个坑则说明,自我管理的训练并不天然收敛,需要在训练结构上专门处理,否则模型要么不用记忆,要么过度压缩把证据弄丢。对做搜索智能体的团队,Traverse 给的提醒是:与其堆更多搜索步数,不如先把「记什么、何时重置」当成可学习的策略来训,再让模型在真实网页的长尾干扰里自己找平衡。
这也解释了为什么「自主压缩优于自动 compaction」的消融值得记:压缩是被动的、规则统一的;自主管理是主动的、按需的。前者省了篇幅却可能丢证据,后者把取舍权交给智能体本身,代价是训练要专门稳住。对工程落地,这条经验同样适用——与其上统一的上下文压缩策略,不如给搜索智能体一个可学习的「留与弃」开关。