一句话:harness 里哪个组件值钱,终于有人算账了
9 月 17 日挂上 arXiv 的论文「How Do Agent Harnesses Create Value?」(arXiv 2609.20474)干了一件行业里欠了很久的事:把 agent harness 的两个核心组件——规划指导与完成度校验——拆开来,分别计价。结论很实用:在 Retail 场景的 265 个配对单元上,预写计划让 oracle 验证成功率提升 7.17 个百分点;而一个只读的终局验证器,每集额外成本不到一美分,却能拦下六成无效轨迹。
这篇论文的稀缺之处在于实验设计。多数「加规划有没有用」的对照实验,对照组是「什么都不给」——但那测出的是上下文占位与内容贡献的混合效应。这篇论文的对照组是 Sham:把任务计划打乱顺序、保持字数完全一致的乱序文本。模型拿到的上下文一样长、一样「看起来像指导」,剩下的区别只有内容有没有用。这样剩下的差异,才能干净地归给「规划内容」本身。
规划的 7 个点,藏在复杂任务里
7.17 个百分点是平均数,它的 90% 置信区间从 1.15 横跨到 13.36——真正的信息在分布里:收益集中在更高复杂度的任务上。简单任务里,模型自己就能走对,计划给不给、给的是真计划还是乱码,差别不大;任务一复杂,步骤之间的依赖变多,一份写对了的计划才显出价值。
这个结论对工程团队的含义很直接:规划指导不是越多越好,而是要花在刀刃上。给简单任务预写详细计划,是在为不会出错的环节买保险;把规划预算挪到复杂任务上,同样的字数能换来更多成功率。反过来,如果你的 agent 场景全是简单任务,这笔预算可以先省下。
验证器:一分钱的闸门
论文的另一半把「完成度校验」单独计价。一个只读的终局验证器——不参与执行,只在任务结束时检查一遍——在 Retail 场景里拒绝了 61% 被 oracle 判定无效的轨迹,代价是把 17% 的正确轨迹也拦了下来(宁可错杀的保守性),而每集的额外成本不到一美分。
61 对 17 的交换比好不好,取决于一件事:误放行的代价有多高。这正是论文最有价值的框架——责任杠杆。误放行代价低的场景(比如内部测试环境),规划带来的 7 个点收益占主导;误放行代价高的场景(资金操作、对外承诺、不可逆动作),验证器避免的那部分误放行,价值会压倒规划的一切收益。而且在高责任场景里,单独部署验证器就能拿到「规划加验证」整套组合的大部分防误放收益,成本只是零头。
给采购和架构的三条决策线
把论文的发现翻译成可执行的决策规则,大致是三条。其一,先给自己的场景标价「误放行」:一次错误通过值多少钱,这个数字决定验证器和规划哪个优先。其二,规划预算按任务复杂度分配:复杂任务写计划,简单任务给自由度——论文的数据支持这种不对称投入。其三,验证器先行:如果要在一美元的预算里选一件先上,高责任场景先买验证器,低责任场景先买规划。
值得一提的是方法本身的外溢价值。「同长乱序对照」这个设计,不只适用于规划研究——任何想证明「加进 prompt 的东西有用」的场景(工具描述、记忆摘要、few-shot 示例)都该问一句:换成同样长的乱序文本,效果还在吗?行业里大量「加了就涨点」的结论,都欠这样一次对照。至于论文结论向其他基准与领域的迁移效果,官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
放到 harness 军备竞赛的背景里看
过去几个月,harness 已经从工程黑话变成行业主战场:评测在考 harness 的演化,架构在为长时程重设计,厂商把「我们的 harness 比模型聪明」当成卖点。但热闹之下缺一份账本——组件各自值多少钱、什么场景值多少,没人说清。这篇论文补上了账本的一页:规划是有条件的收益,验证是便宜的保险,责任杠杆决定次序。对正在搭建生产级 agent 的团队,这比任何「全都要」的清单都更有用。