7月31日下午,DeepSeek悄然公测V4-Flash-0731 API版本,成为2026年下半年开年最受关注的一次单模型发布。最反直觉的地方在于:模型架构没动。284B总参数、13B激活的MoE架构、1M超长上下文,与4月预览版完全一致;变化的全部来自后训练(post-training)与Agent框架优化。正是这次「不堆参数、只调后训练」的更新,让Flash的Agent能力出现跨越式跃升,并叠加MIT开源权重与极致低价,把「买更强模型要不要加钱」这个问题重新摆到了桌面上。

一、架构不变,能力质变:后训练释放的潜力

DeepSeek的更新日志写明,V4-Flash-0731「保持与预览版相同的模型架构与规模,仅做了重新后训练」。结果却很夸张:公司公布的Agent基准较预览版全面抬升,DeepSWE从7.3飙至54.4(涨约7.5倍),Terminal-Bench 2.1达82.7(预览版56.9),CyberGym翻倍至76.7,Toolathlon-Verified 70.3,NL2Repo 54.2,Agent Last Exam 25.2。其中Terminal-Bench 82.7已逼近Claude Opus 4.8的85分区间。需要交代的边界是:这些跑分是厂商自报,公开基准使用了尚未开源的「DeepSeek Harness」最小模式、最大推理力度、top_p=0.95、temperature=1.0,外部研究者暂时无法完整复现;DSBench-FullStack与DSBench-Hard则来自DeepSeek内部测试集。换句话说,数字可信度高于多数发布,但仍非第三方独立验证。即便如此,「架构不动、能力翻几倍」本身就说明:模型能力提升不一定靠堆参数,后训练与Agent框架(Harness)工程是另一座金矿。

二、MIT开源 + 极致定价:智能便宜到「无需计量」

与能力同步放出的是模型权重:V4-Flash-0731以MIT许可证在Hugging Face无门槛开源,含投机解码模块,以更小的激活参数量超越V4-Pro预览版。价格更是把「普惠」写进定价表——输入仅¥1/百万token、输出¥2/百万token,命中缓存的上下文低至¥0.02/百万token(海外口径$0.14/$0.28)。Artificial Analysis智能指数得分50,较上代提升10分,单位任务价格被社区称为「无人能敌」。社区里有人把它类比「DeepSeek时刻」,称「智能如此便宜以至于真的不需要计量」。与之呼应,乌兰察布还在北京西北约350公里处扩建1GW算力,一边推高效模型一边大幅扩张计算能力。对开发者而言,「加量不加价」的体现在于:Flash公测仅限API端,App与网页端暂未更新,但Cline等工具已快速适配,YouMind(玉伯)宣布免费开放。

三、原生Responses API + Codex适配:零门槛迁移

除分数与价格,两项工程改动同样关键。其一是原生支持Responses API——这是OpenAI新格式的接口,V4-Flash因此成为当前DeepSeek唯一支持该格式的模型(Pro版预计8月初才跟上),开发者可在不改造现有代码的前提下切换模型。其二是第一方Codex适配:DeepSeek提供了自动化配置脚本,V4-Flash-0731可接入Codex CLI、ChatGPT桌面端与VS Code扩展,作为自定义模型提供商直接调用。这让「把DeepSeek当Agent工作负载跑」从理论变成当天就能试的真实工作流。思考/非思考双模式也保留,简单任务关掉思考可大幅压低token消耗;最大输出支持38.4万token,配合FP4/FP8低精度推理,可稳定部署在国产AI芯片上,私有化落地成本进一步下降。

四、客观看:挑战路由逻辑,但前提要算清

行业判断很直接:当Flash的代码Agent能力逼近Opus 4.8、价格仅其几十分之一时,「把昂贵任务路由给更大模型」的商业逻辑面临根本性挑战——很多原本要上旗舰模型的活,现在用Flash就够了。但边界必须讲清:第一,核心Agent跑分依赖未开源的DeepSeek Harness,完整复现要等该框架释出,当前结论应视为厂商强证据而非铁律;第二,价格「加量不加价」指的是API公测价,DeepSeek同时预告将引入峰谷定价(9:00-12:00、14:00-18:00为高峰、价格翻倍),真实成本需按业务时段精算;第三,Flash定位是「普惠型工程模型」,专注规模化Agent落地,高难度推理仍留给即将发布的V4-Pro正式版。V4-Flash的意义,不在于又一款便宜模型,而在于它用一次后训练证明:模型竞赛的下半场,比的可能是「同样架构能调出多少Agent能力」,以及「每单位智能到底卖多便宜」。