瓶颈从能力移到了策略
编码智能体做科学发现与算法探索,已经有一批可参照的系统。它们在数千个循环里提出、测试并改进候选方案。但当搜索空间变大之后,真正决定效率的常常不是模型本身能不能想出好点子,而是它如何组织这次搜索:先追哪条线索、什么时候放弃某个方向、并行跑几路。
Google 与马里兰大学、弗吉尼亚大学的研究者把这层称为探索策略,并围绕它提出了一套名为 Dream-RSI 的框架。这个名称里的 RSI 指递归自我改进,但它的递归位置与通常讨论的那类并不相同——这一点是理解整篇论文的关键。
为什么不能在线上学策略
最直接的想法是让智能体一边跑一边改进策略。问题在于这样做极其昂贵。一个新的探索策略好不好,要等它跑很久、看到结果才能判断;而可选的策略数量又多到无法逐一实测。每一次测试都意味着新一轮真实的智能体调用与评估。
这就形成了一个循环依赖:想省算力,就得先知道哪个策略省算力;想知道哪个策略省算力,就得先花算力去测。论文要解决的就是这个循环。
把历史打包成模拟器
Dream-RSI 的做法是不再把过去的探索记录当废料。它把一次已完成的搜索的完整记录——每条试过的分支、每个被打分的中间结果——转换成一个「重播模拟器」,论文里称为一个 world。因为路径上每个节点的结果都已经确定,新策略可以直接在这份历史记录上重放,而不必真的再调用一次智能体。
研究者的描述是智能体在「做梦」:它想象出数千种自己搜索策略的替代版本,逐一对阵自己对过往尝试的记忆,选出在质量、成本与并行度上综合得分最高的那个。改进后的策略被部署到下一轮真实探索中,而这一轮又会产生新的发现历史,从而扩大下一轮做梦可用的模拟器池。
这套机制在思路上借用了模型驱动的强化学习方法,但作用的位置不同:不是在感知与控制层,而是在搜索策略层。
递归发生在策略层,不在权重层
论文里一个必须说清楚的事实是:编码智能体本身、评估器,以及真正干活的模型全程不变。实验中使用的是 Gemini-3.1 Pro 与 Gemini-3.7-Flash,通过 Gemini CLI 调用。轮与轮之间被改写的只有探索策略的代码——本质上是一个轻量的编排层。
这解释了为什么「递归自我改进」在这篇论文里的含义,与「一代模型训练下一代模型」的用法不同。它没有动权重,也不需要先让模型学会改自己的代码。被迭代的对象是调度决策:怎么开并行、何时止损、算力往哪倾斜。这些过去多由人类系统工程师凭借经验拍板的判断,进入了自动迭代的循环。
三个域上的实测数字
论文在三个差异较大的方向做了测试。在算法工程方向,任务是发现 Lasso 正则化路径的实现,Dream-RSI 产出的求解器在六个留出数据集上优于 scikit-learn 与 glmnet 等标准库,同时比此前的发现系统 SimpleTES 少用约 162 倍智能体调用,比采用固定、不改进策略的自身版本少用约 1.7 倍。
在数学优化方向,任务包括和差问题、自相关不等式与圆填充,Dream-RSI 在达到或超过既有发现系统的同时,所用代数只有 SimpleTES 的一小部分,部分场景下折算的算力成本低 50 倍以上。在 GPU 内核工程方向,基于 KernelBench 的 VGG16 与 LayerNorm 等负载,它在达到相近性能时少用最多 2.43 倍代数,或在同等算力预算下把性能提高到约两倍。
这些数字均为论文自报口径,评估器与基准的选择由研究者设定,尚无独立复现的公开结果。把它们当作方向性证据比当作可横向比较的榜单更稳妥。
一个反直觉的发现
研究者还试了一种更简单的历史利用方式:把过去的搜索轨迹总结成自然语言建议,塞进智能体的提示词。这种做法持续地不如让智能体直接在完整模拟器上重放与测试策略。
论文把原因归到指导的副作用上:关于「下一步该往哪搜」的过度具体建议,倾向于把探索范围收窄得太早。这与工程直觉相反。人类习惯把「吃一堑长一智」当作优点,形式化的经验总结也确实便于传递;但在搜索空间里,一份概括过的经验相当于给后续探索预设了方向,而方向一旦预设,那些看起来不像正确答案的区域就不再被访问——它们往往正是更好的解所在。
结论并不否定经验的价值,而是指出经验的表示形式会改变探索行为。把历史作为可复现的数据留存,与把历史压缩成一句建议,两者对后续搜索的影响方向并不一致。这也是这篇论文里对工程实践最有迁移价值的一条。
边界与待验证的问题
这套方法有两处需要持续观察的地方。一是评估器与编码智能体在循环中保持不变,这意味着策略的改进空间受限于评估器与工具集的质量;如果评估信号本身有偏,重放模拟器会把这个偏差更高效地放大,因为它让策略在同样的偏差上做了上千次演练。
二是「在历史里做梦」的有效性依赖历史覆盖的广度。当问题类型与前几轮差异较大时,模拟器里可参考的路径就变少,重放出来的结论未必能迁移。论文没有给出跨域迁移的定量结果。
从工程落地角度看,这套框架对团队的现实启发是把探索日志当作可复用的资产而不是调试残留。论文里被反复利用的正是那些看起来最没用的部分——失败分支与被打低分的中间结果,因为它们的结局已知,恰好构成免费的验证集。
结语
这篇论文的价值不在于它让某个基准的分数提高了多少,而在于它把「怎么搜」从一种依赖个人经验的手艺,变成了可以被自动搜索的对象。当模型的原始能力逐渐接近,调度决策带来的差距会越来越显眼——这也是它值得被认真对待的原因。真正的考验在交叉验证:当另一组研究者用不同评估器复现这套流程时,策略层的收益是否仍然稳定。