不动权重的自我改进,跑出了实数
9 月 21 日前后提交至 arXiv 的 Designer-RSI(编号 2609.22086)演示了一条与主流「继续训练」路线截然不同的智能体进化路径:把前沿大模型完全冻结,不做任何权重更新、不依赖人工标注,只靠一个自然语言写成的程序记忆库,让智能体在真实用户流量中越用越强。结果数字相当可观——在 1406 条真实设计需求上迭代五轮后,执行成功率从 72.7% 升到 99.3%,基座是 Claude-Sonnet-4。
系统的运行环境是一个对接 230 多个设计软件工具的智能体。每一轮执行后,系统把成功与失败的轨迹整理成自然语言技能:新流程被提炼入库,旧流程按失败证据修订。下一轮执行时,智能体带着更新后的技能库重新进场。经验不是存在参数里,而是以可读、可检查、可修订的程序形态存在——这正是它敢叫 RSI 的底气:递归改进的对象从模型权重换成了外置技能库。
匹配回放:防止「修一坏一」的关键护栏
这类经验提炼方法的老大难问题是一处典型副作用:为了让某个失败案例通过而修订流程,可能在别的任务上引入回归——修好一个失败,弄坏三个既有成功。Designer-RSI 的应对是匹配回放机制:技能修订入库前,先在与该修订匹配的历史任务上回放,确认没有破坏原有成功案例才放行。这个护栏让技能库可以持续生长而不劣化,也是五轮迭代能一路爬坡到 99.3% 而不震荡的技术前提。除真实流量外,系统在多个设计基准上也胜过无技能版本,说明增益不是过拟合某一类请求。
两条 RSI 路线的分野
把这个工作放到本周的行业语境里看会更有味道:阿里云云栖大会上 Qwen 团队宣布递归式自我改进技术落地、Qwen4 正在训练,走的是动权重、堆算力的路线;Designer-RSI 则演示了另一条路——模型不动,动的是外置经验。两条路线不冲突,甚至可能互补:权重侧负责能力上限,技能库侧负责场景贴合。但对多数没有万卡集群的团队来说,Designer-RSI 这条路的可复制性明显更高——它需要的不是算力预算,而是一条能稳定拿到真实用户反馈的产品管道。
局限也要摆清楚:实验集中在单一专业设计软件场景,跨领域的迁移能力未经验证;自动评分器自身的噪声会进入反馈环,论文也承认评分误判可能被固化进技能库。此外,技能库随时间膨胀后的检索与冲突管理,是这类系统规模化后的下一个课题。但方向本身已经足够清晰:当「让模型更强」的成本曲线陡峭起来,「让同一个模型在具体场景里用得更好」的工程路线正在快速兑现。对于正在做垂直智能体的团队,这篇论文提供的不只是数字,而是一套可以直接抄的工程结构——轨迹整理、技能提炼、回放验证,三件套都不挑基座模型。
落地抄作业的三个前提
想把这套结构搬进自己产品的团队,需要先备齐三个前提。一是稳定的真实流量:Designer-RSI 的技能来自 1406 条真实需求,没有流量就没有经验,模拟数据练不出能打的技能库;二是可执行的验证手段:匹配回放之所以能防止回归,是因为旧任务有可复跑的判定标准,如果你的场景里「成功」无法客观判定,技能修订就会失去把关;三是反馈链路的低延迟:五轮迭代能压在可控时间内完成,依赖轨迹到技能的自动化整理,这个环节一旦掺入人工审核,进化速度立刻降一个量级。三个前提齐了,这套方法的投入产出比会非常直白——不动权重意味着没有训练成本、没有算力军备,改的只是几段自然语言。技能库的可读性还附带一个容易被低估的好处:出了错可以人工打开看、直接改,这对要过合规审查的企业场景,比黑箱微调友好得多。