北京时间7月31日凌晨,OpenAI在社交平台X投下一颗降价炸弹:GPT-5.6系列两款模型大幅调价。入门款Luna输入价从每百万Token 1美元降至0.2美元、输出从6美元降至1.2美元,降幅齐刷刷80%;定位「日常干活主力」的Terra输入、输出分别降至2美元和12美元,降幅20%;只有旗舰Sol维持5美元/30美元原价,但新增Fast mode,速度最高提至标准模式2.5倍、价格翻倍。这条消息叠加一天前DeepSeek V4-Flash正式版公测,开发者在同一周迎来双重利好,大模型价格战正式进入白热化。
一、三档分层:把Agent模型卖到小模型价位
这次降价最耐人寻味的,不是降幅本身,而是降在哪一档。Luna被OpenAI明确定位为「面向成本敏感型工作负载的模型」,但它能调用工具、处理长上下文、执行多步工作流——也就是说,它是一个正经能干Agent活的模型,却被卖到了过去简单小模型的价位。横向看,降价后Luna输入价已与上一代GPT-5.4 nano持平,输出价甚至更便宜0.05美元;但两者干的活完全不同,nano主要面向分类、信息抽取、排序等简单高频任务,Luna却能跑长链路工作流。换言之,OpenAI正在把「支撑Agent干活的模型」下沉到「小模型的价格带」,意图很明确:用低价把高频Agent负载从竞品(尤其是DeepSeek、Kimi等开源低价模型)手里抢回来。Terra的克制降幅与Sol的「加速不加价」,则维持了产品分层——旗舰保溢价,中低档拼性价比。
二、降本推手是AI自己:Sol重写了自己的内核
OpenAI给这轮降价的理由很「AI原生」:GPT-5.6 Sol通过Codex接入了生产推理栈,自主重写并优化了运行自己的GPU内核,设计并跑通了数百次推测解码架构实验,最终把端到端服务成本压低约20%、token生成效率提升超15%。官方强调整个过程仍由人类主导,Sol写出的内核需经开源工具FpSan逐项检查才能上线。这等于公开演绎了一遍「AI优化AI」的飞轮:模型越强,越能优化自己的服务成本,成本越低,越有底气降价,降价又换来更多调用与更多优化数据。Sam Altman把这套逻辑形容为「Sol自己帮自己省了钱,特此回馈用户」。不过需客观说明:上述降本数据来自OpenAI自述,具体内核优化细节与可复现性,行业暂未独立验证。
三、价格战白热化:国产低价逼出这轮下调
业内普遍把这次降价视作国产大模型低价攻势的直接回应。以DeepSeek V4系列为代表的国产模型,凭借缓存机制把重复输入成本压到极低,叠加一众国内厂商的平价API,持续分流海外中小开发者。第三方评测也给出佐证:Artificial Analysis的图表显示,完成同等标准任务时,降价后的Luna综合性价比已全面超越DeepSeek V4 Pro;TheAgentReport拆解则指出,DeepSWE基准上Luna每美元约换24个基准分,而Claude Fable 5仅约3.2分,效率差出5到7.5倍,且在Agents' Last Exam上Luna得分反超Fable 5、单任务成本约为对方1%。更微妙的是用户情绪——不少开发者把矛头指向Anthropic,称「压力给到A社,轮到你了」,也有声音直言「感谢Kimi」,把中国开源模型的低价压力视为逼出这轮降价的催化剂。Gartner预计2026年全球AI优化型IaaS支出达375亿美元、同比增约105%,其中推理支出首次超过训练;到2029年推理占比将升至65%以上——当推理成为主要成本,价格自然成为开发者用脚投票的第一变量。
四、客观看:降价红利与Token账单的此消彼长
红利明确:对跑编程Agent、客服Agent等高频场景的开发者而言,Luna的降价意味着Token账单的直线下降——以一个每天消耗5000万输入、500万输出Token的编程Agent估算,Luna月度费用从约2400美元降至480美元。OpenAICFO Sarah Friar披露,Codex与ChatGPT Work周活已破1000万、两周翻近一倍,部分增长正来自因Claude Code账单过高而转投的Anthropic用户;降价后订阅费不变,但调用Luna、Terra消耗更少积分,同笔订阅能干更多活。但边界必须讲清:其一,降价集中在中低档,真正复杂的代码与多模态深度思考仍由原价Sol承担,高端任务的门槛并未降低;其二,随着Agent进入高频场景,模型费用会随调用次数、上下文长度与任务复杂度持续累积,价格战缓解的是单价,却放大了「调用量」这一变量,企业的Token账单仍需要从零散支出变成专门管理的成本科目;其三,性能差距收窄后,价格更易左右选择,但模型厂商的定价权正同步收窄——只有最顶级的模型还握有溢价。这轮80%的降幅,不是价格战的终局,而是「按任务计价」时代到来的发令枪。