问题设定:改 Harness,不改模型
2026 年的智能体工程圈已经基本形成一个共识:同一个模型,套不同的 Harness,成绩和成本可以差出两位数百分点。本站此前的多篇研究——从 Agent Harness 工程范式、AWS Strands Harness 到技能蒸馏路线的 Repo-to-Skill——都在反复验证这一点。RRSI 把这个共识推到了逻辑终点:既然 Harness 决定成败,那能不能让智能体自己把 Harness 改好?
RRSI(Regularized Recursive Self-Improvement of Agent Harnesses,智能体 Harness 的正则化递归自我改进)由 Google Cloud AI Research 联合 UNC 教堂山分校、斯坦福大学与圣路易斯华盛顿大学于 2026 年 9 月 21 日发布,代码以 Apache 2.0 协议开源(可商用),配套 arXiv 论文 2609.24972、GitHub 仓库与项目网站。官方明确标注:这是一个研究项目,不是官方支持的 Google 产品。
它的「引擎/整车」比喻很直观:语言模型是发动机,Harness 是车的其余部分——转向、传动、仪表盘。技术上,Harness 覆盖提示词、控制流、工具接口与记忆/上下文管理。RRSI 的做法是让智能体对这四类部件提出修改、实际测试、保留有效项,然后以改进后的 Harness 为起点进入下一轮循环。「递归」指的就是这个循环本身。
RRSI 不是一个新的智能体框架,而是一台「框架优化器」:它把 Harness 从工程师手写的静态资产,变成了一个可被智能体自己迭代搜索的优化变量——但用四道正则化过滤器,把这类自动进化最容易翻车的「刷榜」问题挡在门外。
架构拆解:提议端退火与四道过滤器
RRSI 的设计分两端,这也是名字里「Regularized(正则化)」的落点。不加约束的自我改进有个经典失败模式:系统反复对着有限任务集调优,记住的是题目而不是机制——分布内涨分迅猛,换个任务就打回原形。RRSI 的全部设计智慧都在于如何约束这个进化过程。
提议端有两个机制:
- 时间退火的编辑预算:进化早期允许大刀阔斧的重构,随着进程推进,逐步把每次修改的幅度压小——先探索结构,后打磨细节,这与优化领域的模拟退火思路同源
- 历史条件化探索:新提案必须参考已经尝试过什么,避免在同一个坑里反复跌倒
选择端是四道过滤器,任何修改提案要活下来必须逐关通过:
| 过滤器 | 拦截对象 | 对应风险 |
|---|---|---|
| 泄漏批评器(Leakage Critic) | 把基准特定知识偷偷写进 Harness 的修改 | 测试集污染——进化的最大合法性风险 |
| 噪声地板(Noise Floor) | 小到无法与随机波动区分的增益 | 把噪声当信号,积累虚假改进 |
| 成本规则(Cost Rule) | 收益配不上运行开销的修改 | 分数涨了、账单涨得更凶 |
| 剪枝器(Pruning) | 不再贡献增量的组件 | Harness 越改越臃肿 |
这四道过滤器的组合值得细品:泄漏批评器管「合法性」,噪声地板管「真实性」,成本规则管「经济性」,剪枝器管「复杂度」。换句话说,RRSI 并不追求「分数最大化」这个单一目标,而是在合法性、真实性、经济性与复杂度四个约束下做带惩罚的优化——这正是「正则化」一词在本体层面的含义。
成绩单:双骨干、两个口径
论文报告了两组独立实验,分别以不同模型为固定骨干。所有数字均系研究者自报,尚未有独立复现:
| 配置 | 基准 | 进化前 | 进化后 | 增益 |
|---|---|---|---|---|
| Claude Opus 4.8(固定骨干) | Terminal-Bench 2.1 | 74.2% | 80.2% | +6.0 |
| SWE-bench Verified | 82.0% | 83.8% | +1.8 | |
| EngDesign(工程设计) | 50.0% | 54.9% | +4.9 | |
| Gemini 3.5 Flash(固定骨干) | Terminal-Bench 2.1 | 64.6% | 78.7% | +14.1 |
| SWE-bench Verified | 76.8% | 79.0% | +2.2 |
两个容易被误读的口径,先厘清:
- 「最高 +14.1 分」出现在 Gemini 3.5 Flash 骨干的 Terminal-Bench 2.1 上(64.6% 到 78.7%)——起点越低、可挖的 Harness 红利越大;而 Opus 4.8 骨干在同一基准上「只有」+6.0 分,因为它的起点已经是 74.2%。跨骨干比较增益百分点的绝对值没有意义
- 分布外保留增益 +4.7 分:在五个未参与进化的分布外基准上,进化后的 Harness 仍带来平均 4.7 分的提升——这是判断「学到机制而非记住题目」的关键指标。部分报道提及六个 held-out 分割均有增益,与「五个分布外基准」属于不同统计口径,均出自研究者自报
- 效率项:RRSI 的策略 token 消耗比不加正则化的进化方式低约 30%——过滤器在拦截坏提案的同时,也省下了大量无效试错的推理开销
测试域刻意做了多样化覆盖:编码走 Terminal-Bench,工作区任务走 Harvey LAB,工程设计走 EngDesign。另一个实用性很强的发现是跨模型迁移:用 Gemini 3.5 Flash 进化出的 Harness,换到其他(包括更小的)Gemini 变体上依然有效——Harness 的改进至少部分是模型无关的。
绝对分数容易让人麻木,换成失败率视角更有冲击力:Opus 4.8 骨干在 Terminal-Bench 2.1 上失败率从 25.8% 降到 19.8%,约四分之一的失败被「改软件」消除了——而这全程没有动模型一个参数。
14.1 与 4.7 之间:过拟合的直接证据
如果只看头条数字,RRSI 是一个成功故事。但这篇论文最有价值的部分,恰恰是 14.1 分与 4.7 分之间的落差:进化集上的最大增益到分布外基准只剩三分之一左右。这正是无约束自进化过拟合的直接证据——系统确实记住了训练任务的分布特征,而不是全部转化为可迁移机制。
论文没有回避这一点,而是把它转化为方法论要求:任何搭建自我改进循环的团队,都必须配置一组从不参与进化的隐藏评估集。这与企业 MLOps 中「训练/验证/测试」三分的基本纪律同构,但在自进化场景下更容易被忽略——因为进化过程本身会「消费」你能看到的所有评估信号。
对工程团队的启示可以落成三条:
- 评估集隔离:进化可见集与验收集物理分离,验收集只在最终评估时使用,绝不回流进提案筛选
- 增益显著性门槛:模仿噪声地板思路,任何被采纳的修改都要先证明自己不是随机波动——小样本 benchmark 单次运行的涨跌没有决策价值
- 成本入账:自进化的每一轮都要烧推理预算,「分数/成本」比而不是裸分数才是优化目标
横向对照:自进化的三条路线
把 RRSI 放进 2026 年的坐标系里看更清楚。目前「让智能体变强但不改模型」的路线至少有三条,各自押注不同的优化对象:
| 路线 | 代表 | 优化对象 | 本质 |
|---|---|---|---|
| 静态默认值 | AWS Strands Harness(本站 R-TECH-24) | 把共识工程实践固化为开箱默认配置 | 人写一次,所有用户复用 |
| 技能蒸馏 | BAAI Repo-to-Skill / DisCo(本站 R-TECH-19) | 从代码仓库蒸馏可复用技能库 | 离线挖掘,运行时检索装配 |
| 在线自进化 | Google RRSI | Harness 本身(提示词/控制流/工具/记忆) | 智能体自己提议、自己验证、自己迭代 |
同期还有一条旁证:Google DeepMind 的 Dream-RSI(arXiv 2609.14858,2026 年 9 月)让编码智能体从历史尝试构建回放模拟器来改进搜索策略,据报道在路径求解任务上把发现型智能体的调用次数大幅降低——同样全程不动模型权重(该数字系媒体转述,详见参考来源)。两条论文互为印证:Harness/策略层的自我改进,是当前门槛与风险都可控的「能力增量」来源。
三条路线并非互斥。一个合理的预期是:静态默认值解决「从 0 到 60 分」,技能蒸馏与自进化解决「从 60 分往上的长尾」——而自进化路线的治理成本(评估隔离、过滤器工程)显著高于前两者。
边界与冷思考
- 全部数字系研究者自报:论文结果与特定基准套件和实验设置绑定,作者自己也声明这不构成对其他模型或场景的泛化证明,更不等于模型底层能力提升;独立复现尚待时日
- 进化成本未完整披露:跑完一轮 RRSI 需要多少推理预算、多少时间,公开材料未给出完整账目——对想复现的团队这是关键缺口。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态
- 过滤器的对抗性:泄漏批评器本身是模型判官,理论上存在「更聪明的作弊提案绕过批评器」的攻防空间;过滤器自身的可靠性是这套方法的隐性前提
- 企业落地距离:RRSI 面向的是基准任务的自动优化;真实企业场景的任务分布漂移、隐私约束与审计要求,论文未涉及——直接把「自进化」搬进生产环境前,先回答「进化出来的 Harness 谁来审」
- 发布口径:多家媒体于 9 月 21 日至 10 月初陆续报道,论文编号 2609.24972,以官方仓库与论文为准