一句话:当编码智能体铺到上万席,账单是谁签的,往往不是人
2026 年 9 月 24 日提交的一篇 arXiv 论文(2609.28919)《Control the Harness, Control the Cost》把一个被忽视的事实摆上台面:企业把 AI 编码智能体跑在厂商 harness(如 Anthropic 的 Claude Code、OpenAI 的 Codex)上,而真正决定花多少钱的,往往不是模型本身,而是这个 harness——它替企业挑了价目表上的那一档、决定了采购量,还顺手定下了提示缓存怎么用、子智能体起不起。换句话说,把 harness 当中性工程层,账单就会自己长大。论文据此提出一个可落地的路由与控制平面方案。
为什么 harness 是财务杠杆,而不只是工程组件
论文的出发点是部署规模的跃迁:编码智能体的试点往往几百席,如今正滚到上万席。大多数企业不自己造 harness,而是买大厂的。一个 harness 在一次请求里就决定了用哪个模型回答、模型读哪些上下文、提示缓存怎么用、要不要起子智能体——这些全是价格表上的选项。企业若把一套未调优的 harness 停在默认配置,就相当于把这些选择连同账单一起继承了下来。作者用一个名为 Jev 的路由做了实证:一个用户回合其实是落在同一个模型提示缓存上的多次请求,所以路由只能在不会逼着重建缓存的时刻动手。
Jev 路由:只在安全切换点换模型,保住缓存
Jev 是一个带校准概率的分类器,把每一条提示归到企业自定的请求分类法里,再据此决定路由。它刻意只在三类安全点移动工作:会话开始、旁路 lane、子智能体启动——因为这些时刻还没有一段跑着的对话需要丢弃缓存。这样一来,企业可以把常规活计导向更便宜的模型,又不必反复清空已经付过钱的上下文。在按公开数据集行为建模的 1 万席模拟里,这套路由回收了 14% 到 21% 的模型支出,按论文采用的 2026 年 9 月 21 日 Anthropic 列表价,相当于每年 330 万到 500 万美元。论文还顺手测绘了 20 个 harness 的风险、给单一厂商模型的依赖定了个价。
一个被低估的提醒:成本集中在头部长会话
同行评审里有个细节值得单独拎出来:在两类语料上,头部 1% 的会话吃掉了 31% 到 53% 的支出,超过 200 次调用的长会话(占约 8%)贡献了九成以上的花费。这和论文的路由结论互为印证——省钱的杠杆不在「换更便宜的模型」这种全局动作,而在盯住少数又长又贵、又最容易在缓存与子智能体上失控的会话。另一篇 7 月由 Writer 团队发布的受控实验也指向同一方向:只换编排层、不动模型,混合单任务成本就能降约 41%。两条证据合起来说明,编排设计正取代模型选择,成为企业 AI 账单真正的主控阀。
结论:把 harness 纳入企业的控制平面
论文的落地建议很克制:企业现在就该从内部跑起一个控制平面,先把请求分类、允许使用的模型、缓存感知路由与每次子智能体交接的留痕定下来,再谈扩大访问。采购问题也会随之改变——下一句要问的不是「买了哪个模型」,而是「哪个 harness 在决定它何时、为何、多频繁地跑」。对正在把编码智能体从实验推到日常开发的团队,这篇论文把「成本治理」从财务事后的抱怨,提前变成了架构里可度量的环节。
优势与局限:思路清晰,实证仍有边界
优势在于把抽象的「AI 太贵」拆成了可操作的控制点:分类、缓存感知路由、长会话专项治理,且给出了一组可复现的回收区间。局限也要记:其一,模拟基于公开数据集的行为建模与列表价,不是真实账单,长尾区间依赖少量高花费会话;其二,Jev 的分类法需要企业自己维护,接入成本不低;其三,20 个 harness 的风险测绘是快照,会随厂商更新漂移。关于更细的生产验证,论文及行业暂未披露更多细节。
结语
《Control the Harness, Control the Cost》把编码智能体的成本话题,从「换个便宜模型」推进到「谁在控制 harness」。它真正的价值不在那 14% 到 21% 的回收区间,而在于提醒企业:当智能体铺到上万席,治理必须落在切换点,而不是每月看一张总账单。这道控制平面,正成为智能体规模上线前越来越绕不开的一关。