8月4日,OpenRouter 数据显示,DeepSeek V4-Flash 正式版登顶过去一周全球模型调用量榜首;仅8月1日单日,它处理的 Token 就达到8万亿,其中5万亿来自免费额度、3万亿来自付费调用。此前 OpenAI 把 GPT-5.6 Luna 输出价砍掉80%至每百万1.2美元,仍比 V4-Flash 贵约60%。这串数字背后是一个正在固化的格局:中国开源模型已连续14周包揽全球调用量前五。当「谁被用得最多」开始由性价比而非名气决定,Agent 基础设施的竞争天平,正悄悄向开源一侧倾斜。
一、8万亿 Token/日:调用量即话语权
OpenRouter 聚合了多家模型的 API 流量,其调用量大致近似开发者与企业的选型风向标。V4-Flash 在8月1日单日处理8万亿 Token、登顶周榜,是一组有分量的采用信号。值得注意的结构是:5万亿来自免费额度、3万亿来自付费调用,免费占比高,说明大量开发者先用免费额度试水、再转向付费,漏斗相对健康。这与闭源旗舰靠品牌与生态锁定用户的逻辑不同——开源模型靠可迁移性与价格去抢「使用量」这一最硬的投票。调用量本身不直接等于收入,但它决定了生态、工具适配与开发者习惯的走向,而这些最终都会反哺商业。
二、价格仍是硬道理:Luna 降价后仍贵60%
价格这道坎,V4-Flash 跨得干脆。OpenAI 自8月1日起把 GPT-5.6 Luna 输出价压到每百万1.2美元(降幅80%),但按行业对比仍比 V4-Flash 贵约60%。而 V4-Flash 本身是 MIT 开源权重、每百万输入约1元、原生支持 Responses API 并适配 Codex 的模型——也就是说,它把「后训练红利」直接转化成了「可规模化的低价 Agent 能力」。回顾其公测表现:2840亿总参、130亿激活的 MoE 架构,百万级上下文,仅靠一轮后训练就把 DeepSWE 从7.3分拉到54.4分。公式很清楚:后训练把能力做厚,开源把门槛做低,价格把用量做大。「高性价比」不是噱头,而是一套可复制的采用逻辑。
三、连续14周前五:开源模型的「用脚投票」
中国开源模型连续14周包揽全球调用量前五,是开发者用真实流量投出的信任票。它与 Kimi K3(2.8万亿参数开源)、即将开源的 Qwen3.8-Max 形成共振,让开源阵营在「可用性 + 成本 + 可控」这个三角上拧成一股合力。对 Agent 基础设施的含义很直接:应用层不必绑死在单一闭源 API 上,借助 Responses API 的兼容,可以近乎零成本在开源模型间迁移,厂商锁定被显著削弱。当「换模型」的成本低于「续费闭源」的沉没,基础设施的主导权就从「谁最强」部分转移到「谁最可被替代」——而这恰恰是开源最擅长的地方。
四、客观看:调用量登顶的成色与边界
价值在于,V4-Flash 以硬数据证明了开源模型在 Agent 时代的采用统治力,验证了「性价比是真实护城河」这一判断,也为应用层用更低成本跑通 Agent 工作流打开了空间。但边界要如实标注:其一,OpenRouter 的调用量偏开发者与技术用户,不等同全市场规模——企业私有部署、直接调用闭源 API 的流量并未计入,结论有样本偏差;其二,免费额度占比高可能放大总量,付费转化与留存仍待观察,调用量不等于收入、更不等于利润;其三,极致成本换份额的商业模式能否持续,要看单位经济模型是否成立(可参照 DeepSeek 方面「十个月回本」的表态)。数据来自 OpenRouter 及北京日报等报道,具体以平台公开口径为准。登顶是事实,而它能否沉淀为持续的商业优势,要看开源阵营把「被用得多」转化为「被付得多、被留得住」的能力。