提升一个浏览器智能体的任务完成率,通常的思路是换更强的模型、刷更多训练数据。Salesforce AI Research 的 DarwinX 却给出了一条更省力的路:模型权重一字节都不动,只改模型外面那一层「脚手架」,就把 WebArena-Infinity 上的通过率从 43.5% 拉到了 93%。这篇 7 月 31 日提交到 arXiv 的论文(编号 2608.07545),连同 9 月 2 日开源的 Beagle 框架,把「智能体优化」从手工调提示词,升级成了可自动演化的工程方法。

harness 是什么:模型之外的那一整层

一个智能体的表现,远不止取决于权重。模型读取的系统提示、可调用的工具定义、挂载的技能、驱动动作的控制流、以及它记下的笔记与工作流,共同构成了一层「harness」(中文常译作执行框架或脚手架)。这层东西通常靠人手维护:某人发现一个失败模式,就改一句提示词,再看是否好转。DarwinX 的洞见是,既然 harness 决定了智能体能做什么、做不做得对,那它本身就是可以被自动优化的独立对象——而且优化它,不需要你碰模型内部。

DarwinX:把 harness 当种群来演化生成 harness 变体改提示、工具、技能、工作流在任务上打分用基准自带确定性验证器保留-扩展契约可加能力,但不得破坏已工作的任务合并互补分支把不同专长的 lineage 重组模型权重全程冻结——优化发生在模型之外那一层,而非模型内部
图 1|DarwinX 把智能体的「脚手架」(系统提示、工具定义、技能、工作流、记忆与控制流)当作一个种群来演化:生成大量变体、用确定性验证器打分、靠保留-扩展契约防止新变体破坏旧任务,并把互补分支合并进归档。

三个机制:把「试错」变成「自然选择」

DarwinX 把 harness 的优化建模成一场自然选择。它会同时维持一整个种群的 harness 变体,而不是只留一个「当前最好」版本反复打补丁。论文点了三个把种群管住的关键设计。其一是保留-扩展契约:一个新变体可以新增能力,但不得破坏任何一个已经能跑通的任务——这直接针对手工调参常见的「修一个漏一个」。其二是种群式归档:不同专长的分支可以后续合并,避免为了新能力而丢掉旧能力。其三是共享接口:改进信号来自三个源头——失败分析、教师模型的提示、以及智能体自己的提案,统一吸收进同一套接口。

数字说话:冻结 GPT-5.5 下的跃迁

在冻结 GPT-5.5 的前提下,DarwinX 在 WebArena-Infinity 上把审计后通过率从 43.5% 抬到 93.0%,无效轨迹则从 23.5% 降到 1.4%。在 Terminal-Bench 2.1 上,GPT-5.5 的得分由 75.5% 升到 83.2%;更关键的是转移测试——一个在 Terminal-Bench 2.1 上演化出的 harness,未经任何修改直接用到 SWE-bench Verified,达到 84.2%(基线 80.8%)。团队还在 Claude Opus 4.8 上验证了这套 harness 的边际优势依旧成立。承载 DarwinX 核心算法的 Beagle 框架已在 GitHub 以 Apache 2.0 协议开源。

四基准上的增益(冻结 GPT-5.5)WebArena-Infinity93.043.5% → 93.0%Terminal-Bench 2.183.275.5% → 83.2%SWE-bench Verified84.2转移 80.8% → 84.2%TerminalWorld68.361.0% → 68.3%无效轨迹从 23.5% 降到 1.4%;SWE-bench 上未给任何反馈即转移成功
图 2|在冻结 GPT-5.5 的前提下,DarwinX 把 WebArena-Infinity 的通过率从 43.5% 拉到 93.0%,无效轨迹由 23.5% 降到 1.4%;在 Terminal-Bench 2.1 上演化出的 harness 未经修改即转移到 SWE-bench Verified,达到 84.2%。

为什么重要:性能天花板不该只由模型决定

这套方法的现实意义在于,它把「提升智能体上限」从「等下一代权重」里部分解放出来。对任何只调用商业 API、没有自有机型训练管线的团队,harness 是他们本就能掌控的一层。换句话说,与其苦等模型升级,不如先把脚手架调好——而且这次是让程序自动调,而不是靠工程师拍脑袋。对已经跑起智能体的企业来说,这意味着一条更低成本、更可复用的优化通道。

风险与边界:别把基准上的胜利当成生产里的胜利

但 DarwinX 的边界也要说清。最显眼的风险是过拟合:一个针对某套基准演化出来的 harness,可能只是把那套基准「刷」明白了,而非获得了通用能力;SWE-bench 的转移虽然亮眼,但目前仍只是单一参考点。其次,论文的结果目前集中在 GPT-5.5 与 Claude Opus 4.8,对开源权重模型是否同样成立尚未验证。更根本的约束在生产环境:没有可靠验证器的真实工作流,演化无从谈起。论文对此的建议很务实——团队应维护一套由真实任务构成的代理评测套件,定期跑演化,且只部署通过回归检查的版本。

结语

DarwinX 给行业的提示很朴素:模型很重要,但包在模型外面的那层脚手架同样重要,而且它是可以被系统化、自动化优化的。当「改提示词、改工具、改工作流」被纳入一套可演化的工程方法,智能体性能的释放路径,就多了一条不依赖换模型的旁支。