2026 年 9 月 1 日至 10 日,五家前沿模型厂商在十天里密集发布新品:Anthropic 的 Claude Fable 5.1、Google 的 Gemini 3.8 Flash、Meta 的 Muse Spark 1.3、OpenAI 的 GPT-6 Astra,以及 DeepSeek 的 V4.1-Flash。输入价格从每百万 token 0.15 美元跨到 10 美元,跨度达 67 倍;上下文窗口从 100 万到 105 万 token;安全机制从零保留到关键网安阈值门控,各不相同。对坐在台下庆祝创新速度的从业者来说,这是技术繁荣;对把这些模型接进生产系统的智能体构建者来说,这是一笔被长期低估、且逐月复利上涨的税。这种税不写在合同里,却实实在在地吞掉团队的工程预算。

模型连发,重担甩给下游

每一次新模型发布,对构建者而言都意味着一重新的负担,而不是一次轻松的替换。先是基准测试:要和现有栈逐一比对,确认新模型在自家任务上到底变好还是变坏;接着是集成返工:模型路由、编排层、护栏配置都要跟着调;然后是合规审查:不同厂商的缓存策略、峰值与谷价、入门价与标准价各不相同,采购要重新谈;最后是安全复核:新模型触发的护栏配置变了,风险边界也得重新画。实验室庆祝的是发布速度,接进生产的团队消化的是复利成本。

十日连发:五家模型,价格跨度 67 倍 Fable 5.1 9/1 Anthropic 10/50 每百万 缓存 -75% Gemini 3.8 9/2 Google 0.75/3.75 1 月后翻倍 Muse Spark 9/ Meta 1.25/4.25 贡献层更低 GPT-6 Astra 9/3 OpenAI 10/50 每百万 关键网安阈值 V4.1-Flash 9/10 DS 0.15/0.60 谷价更低 安全机制也从零保留到关键阈值门控,各不相同——每家都要单独做合规审查 价格、上下文窗口、护栏配置都不一样,模型切换从不只是换一个名字 对构建者:每发一次新模型 = 一重基准测试 + 集成返工 + 合规审查 实验室庆祝创新速度,接进生产的团队消化复利成本
图 1|十天内五款前沿模型连发,价格与安全机制各不相同,把适配重担甩给了下游构建者

这层负担之所以隐蔽,是因为它不在任何一份产品公告里。模型厂商比的是参数、价格与能力,而构建者比的是「我能不能在不把系统搞崩的前提下,把这波更新接住」。当十天内连发五款,且每款的计价逻辑都不一样,团队光是算清「换哪款更划算」就要花掉不少工程时间——而这还只是决策,不是落地。

数字已经很直白

几份近期调研把这笔税摊开了看。McKinsey 7 月的 Enterprise AI FinOps 调研显示,六成 agentic AI 支出已经耗在「响应精炼」这类反复生成、反复检查的循环上,逾九成企业反映超出了 AI 预算,约五分之一的组织因为运营成本已经开始限制 AI 使用。Stanford 数字经济实验室则把账单大头指认出来:约 62% 的智能体推理账单,来自每次调用都要重发的上下文——系统提示、工具定义与状态,必须随每个请求一起传输。Gartner 2026 年的 AI 成熟度曲线更给出预警:到 2027 年,约四成 AI agent 项目会因成本超支而非技术失败被取消。

评测税:被长期低估的隐性成本 四重来源 基准测试 集成返工 合规审查 路由重排 McKinsey 7 月调研 六成支出 耗在响应精炼 九成超预算 Gartner 2026 曲线 2027 年前 四成项目 因超支取消 Stanford 数字经济体 约 62% 账单 来自重发上下文 每步都重传 智能体每次调用消耗 5 到 30 倍于聊天的 token,账单大头在反复重发的上下文 评测税的实质,是模型迭代速度超过了团队消化迭代的工程能力
图 2|评测税由四重来源叠加,多家调研指向同一结论:成本正成为落地的硬约束

这些数字指向同一结论:智能体每次调用消耗 5 到 30 倍于普通聊天的 token,而反复重发的上下文是账单的核心。模型越迭代,上下文越膨胀,税就越重。构建者要交的,不只是推理费,更是「跟上迭代」的工程费。

评测税的本质与应对

评测税的本质,是模型迭代的速度,超过了团队消化迭代的工程能力。应对这道税,靠的不是少更新模型,而是把评测与适配工程化:用分层评估——小测试集挂在每次提交、大基准留给发布候选、生产监控兜住漂移;把模型选型、提示词版本、工具 schema、评估版本与数据快照都归档,让每次对比可复现;在评测里设预算上限,给每次任务定好最大步数、token 上限与费用红线。说到底,智能体落地的胜负手,正从「谁模型更强」悄悄转向「谁把评测与适配的成本压得更低」。当模型厂商比拼发布节奏时,构建者比拼的是把节奏接住的工程纪律。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。