技术解构 2026-10-01 22 分钟阅读 进阶

Google RRSI 架构解构:让智能体自己重写自己的 Harness

模型权重一动不动,提示词、工具、控制流、记忆全部开放改写 — 四道过滤器把「自进化」从刷榜风险拉回正轨,以及 +14.1 分与 +4.7 分之间那道鸿沟

摘要

2026 年 9 月 21 日,Google Cloud AI Research 联合北卡罗来纳大学教堂山分校、斯坦福大学与圣路易斯华盛顿大学,开源了 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses)框架:在不改动模型任何参数的前提下,让智能体循环地提议、测试、筛选对自身 Harness 的修改。本文基于 arXiv 论文(2609.24972)与多家独立媒体交叉信息,拆解其「提议端退火 + 选择端四过滤」的架构设计、双骨干实验数据,并重点解读「进化集最高 +14.1 分、分布外仅保留 +4.7 分」这组数字背后的过拟合信号。所有分数均系研究者自报,文中已逐项标注。

问题设定:改 Harness,不改模型

2026 年的智能体工程圈已经基本形成一个共识:同一个模型,套不同的 Harness,成绩和成本可以差出两位数百分点。本站此前的多篇研究——从 Agent Harness 工程范式、AWS Strands Harness 到技能蒸馏路线的 Repo-to-Skill——都在反复验证这一点。RRSI 把这个共识推到了逻辑终点:既然 Harness 决定成败,那能不能让智能体自己把 Harness 改好?

RRSI(Regularized Recursive Self-Improvement of Agent Harnesses,智能体 Harness 的正则化递归自我改进)由 Google Cloud AI Research 联合 UNC 教堂山分校、斯坦福大学与圣路易斯华盛顿大学于 2026 年 9 月 21 日发布,代码以 Apache 2.0 协议开源(可商用),配套 arXiv 论文 2609.24972、GitHub 仓库与项目网站。官方明确标注:这是一个研究项目,不是官方支持的 Google 产品。

它的「引擎/整车」比喻很直观:语言模型是发动机,Harness 是车的其余部分——转向、传动、仪表盘。技术上,Harness 覆盖提示词、控制流、工具接口与记忆/上下文管理。RRSI 的做法是让智能体对这四类部件提出修改、实际测试、保留有效项,然后以改进后的 Harness 为起点进入下一轮循环。「递归」指的就是这个循环本身。

🔑 一句话定位

RRSI 不是一个新的智能体框架,而是一台「框架优化器」:它把 Harness 从工程师手写的静态资产,变成了一个可被智能体自己迭代搜索的优化变量——但用四道正则化过滤器,把这类自动进化最容易翻车的「刷榜」问题挡在门外。

架构拆解:提议端退火与四道过滤器

RRSI 的设计分两端,这也是名字里「Regularized(正则化)」的落点。不加约束的自我改进有个经典失败模式:系统反复对着有限任务集调优,记住的是题目而不是机制——分布内涨分迅猛,换个任务就打回原形。RRSI 的全部设计智慧都在于如何约束这个进化过程。

提议端有两个机制:

选择端是四道过滤器,任何修改提案要活下来必须逐关通过:

过滤器 拦截对象 对应风险
泄漏批评器(Leakage Critic) 把基准特定知识偷偷写进 Harness 的修改 测试集污染——进化的最大合法性风险
噪声地板(Noise Floor) 小到无法与随机波动区分的增益 把噪声当信号,积累虚假改进
成本规则(Cost Rule) 收益配不上运行开销的修改 分数涨了、账单涨得更凶
剪枝器(Pruning) 不再贡献增量的组件 Harness 越改越臃肿

这四道过滤器的组合值得细品:泄漏批评器管「合法性」,噪声地板管「真实性」,成本规则管「经济性」,剪枝器管「复杂度」。换句话说,RRSI 并不追求「分数最大化」这个单一目标,而是在合法性、真实性、经济性与复杂度四个约束下做带惩罚的优化——这正是「正则化」一词在本体层面的含义。

成绩单:双骨干、两个口径

论文报告了两组独立实验,分别以不同模型为固定骨干。所有数字均系研究者自报,尚未有独立复现:

配置 基准 进化前 进化后 增益
Claude Opus 4.8(固定骨干) Terminal-Bench 2.1 74.2% 80.2% +6.0
SWE-bench Verified 82.0% 83.8% +1.8
EngDesign(工程设计) 50.0% 54.9% +4.9
Gemini 3.5 Flash(固定骨干) Terminal-Bench 2.1 64.6% 78.7% +14.1
SWE-bench Verified 76.8% 79.0% +2.2

两个容易被误读的口径,先厘清:

测试域刻意做了多样化覆盖:编码走 Terminal-Bench,工作区任务走 Harvey LAB,工程设计走 EngDesign。另一个实用性很强的发现是跨模型迁移:用 Gemini 3.5 Flash 进化出的 Harness,换到其他(包括更小的)Gemini 变体上依然有效——Harness 的改进至少部分是模型无关的。

💡 换个角度读:失败率削减

绝对分数容易让人麻木,换成失败率视角更有冲击力:Opus 4.8 骨干在 Terminal-Bench 2.1 上失败率从 25.8% 降到 19.8%,约四分之一的失败被「改软件」消除了——而这全程没有动模型一个参数。

14.1 与 4.7 之间:过拟合的直接证据

如果只看头条数字,RRSI 是一个成功故事。但这篇论文最有价值的部分,恰恰是 14.1 分与 4.7 分之间的落差:进化集上的最大增益到分布外基准只剩三分之一左右。这正是无约束自进化过拟合的直接证据——系统确实记住了训练任务的分布特征,而不是全部转化为可迁移机制。

论文没有回避这一点,而是把它转化为方法论要求:任何搭建自我改进循环的团队,都必须配置一组从不参与进化的隐藏评估集。这与企业 MLOps 中「训练/验证/测试」三分的基本纪律同构,但在自进化场景下更容易被忽略——因为进化过程本身会「消费」你能看到的所有评估信号。

对工程团队的启示可以落成三条:

  1. 评估集隔离:进化可见集与验收集物理分离,验收集只在最终评估时使用,绝不回流进提案筛选
  2. 增益显著性门槛:模仿噪声地板思路,任何被采纳的修改都要先证明自己不是随机波动——小样本 benchmark 单次运行的涨跌没有决策价值
  3. 成本入账:自进化的每一轮都要烧推理预算,「分数/成本」比而不是裸分数才是优化目标

横向对照:自进化的三条路线

把 RRSI 放进 2026 年的坐标系里看更清楚。目前「让智能体变强但不改模型」的路线至少有三条,各自押注不同的优化对象:

路线 代表 优化对象 本质
静态默认值 AWS Strands Harness(本站 R-TECH-24) 把共识工程实践固化为开箱默认配置 人写一次,所有用户复用
技能蒸馏 BAAI Repo-to-Skill / DisCo(本站 R-TECH-19) 从代码仓库蒸馏可复用技能库 离线挖掘,运行时检索装配
在线自进化 Google RRSI Harness 本身(提示词/控制流/工具/记忆) 智能体自己提议、自己验证、自己迭代

同期还有一条旁证:Google DeepMind 的 Dream-RSI(arXiv 2609.14858,2026 年 9 月)让编码智能体从历史尝试构建回放模拟器来改进搜索策略,据报道在路径求解任务上把发现型智能体的调用次数大幅降低——同样全程不动模型权重(该数字系媒体转述,详见参考来源)。两条论文互为印证:Harness/策略层的自我改进,是当前门槛与风险都可控的「能力增量」来源。

三条路线并非互斥。一个合理的预期是:静态默认值解决「从 0 到 60 分」,技能蒸馏与自进化解决「从 60 分往上的长尾」——而自进化路线的治理成本(评估隔离、过滤器工程)显著高于前两者。

边界与冷思考

核心发现

参考来源

  1. Google Cloud AI Research 等 — RRSI: Regularized Recursive Self-Improvement of Agent Harnesses(arXiv 2609.24972,2026.09.21,附官方 GitHub 仓库与项目网站)
  2. TokenPost — RRSI Raises AI Agent Scores While Keeping Models Fixed(2026.10,含双骨干完整分数与 held-out 口径)
  3. The Clarity — Google's open-source RRSI rewrites agent scaffolding(2026.10,含逐条声明核查账本)
  4. Crypto Briefing / CryptoCortex — Google's RRSI framework lets AI agents rebuild their own harnesses(2026.10.01)
  5. Web Pulse — Google's RRSI framework(2026.10,含四过滤器机制细节)
  6. Google DeepMind — Dream-RSI(arXiv 2609.14858,2026.09,经中文技术媒体转述交叉)