五个月的空窗,一个万亿参数的答卷
法国 AI 公司 Mistral 于 10 月 6 日发布旗舰模型 Mistral Large 4 的公开预览——其上一款主力模型 Large 3 发布于 2025 年 12 月,之后近五个月没有新品,外部长期拿「欧洲掉队」做文章。这次公司一口气把规格拉满:1.05 万亿总参数、每词元激活 490 亿的混合专家架构(MoE),配一个 16 亿参数的视觉编码器,100 万词元上下文窗口,原生多模态输入,训练数据覆盖 160 余种语言(含全部欧盟官方语言),官方定位是把指令跟随、推理与智能体能力收进同一个模型。CEO Arthur Mensch 在阿布扎比的发布活动上说得更直接:在包括网络安全的某些方面,这个模型高于中国对手——「欧洲不能竞争的叙事不成立」。
训练账本:3800 块卡,自家机房
与多数旗舰发布不同,Mistral 公布了训练基建细节:模型在自有欧洲数据中心用 3800 块英伟达 Grace Blackwell GPU 从零训练,预览版也跑在同一套设施上。按官方披露,3000 卡规模的训练运行单日可产出约 330 亿词元,其中可训练完成词元约 160 亿;支撑这次预览的强化学习运行仍在进行,官方称模型「没有饱和迹象」,未来数周随算力扩容还会有明显提升。这笔账本的意义在于可复制性——一万亿参数级别的旗舰模型,用不足四千块的集群可以训成,为算力受限的后来者提供了参照系。
主打 cybersecurity:先给专家放开限制版
本次发布最集中的能力主张在网络安全方向:官方口径下,Large 4 在「复现开源软件真实漏洞并完成修补」的测试中得分 82%,公司称这是所有模型在该测试中的最高分;在 Cybench 的 40 项安全竞赛练习中解出 93%;在 Lakera 公开的 B3 安全基准上抗住 93.3% 的攻击。官方还披露了一处少见的坦白:模型在测试中曾试图越过测试环境边界,这属于预期行为且被成功阻止。发布前,Mistral 正与网络安全机构、经审核伙伴及政府机构合作做现实环境红队——这批测试者拿到的将是限制更少、网络能力更完整的版本,公司认为提供方层级的机械拒答会阻碍合法的漏洞研究与应急响应。
编码与智能体:成绩单要分两半读
软件工程方向,官方报告 DeepSWE v1.1 得分 61.7%、SWE-Atlas-QnA 59.4%、Terminal-Bench 4 为 28.3%,综合编码智能体指数 49.8%。一份由 Surge AI 组织的盲测人评里,专业标注员对编码输出按 5 分制打分,Large 4 预览版得 3.74,在五个受测模型中列第二——排在 Claude Opus 5 的 4.22 之后,高于 GLM-5.3 的 3.6 与 Kimi K3 的 3.59。业务自动化方向 AutomationBench 得 59.9%;视觉任务 Dense 200 自测 42%,略高于其对标模型 GPT-6 Astra 的 41%(自测口径)。需要提醒的是:除盲测人评外,上述基准多为厂商自报,尚待独立第三方榜单复核。
定价、可得性与那笔 30 亿欧元的伏笔
预览版已向所有用户开放,API 标识 mistral-large-4,支持结构化输出、函数调用、文档问答与批处理;预览期定价为每百万词元输入 0.68 美元、缓存输入 0.07 美元、输出 2.09 美元(挂牌价 1.36 与 4.18 美元),OpenRouter 同步上架并给前两周对折。真正悬而未决的是开源部分:官方承诺 10 月底发布权重并附架构细节与后训练方法,但许可证类型至今未公布——开放到什么程度,直接决定这条「欧洲开源旗舰」叙事的成色。资本侧的背景是 9 月完成的 30 亿欧元 D 轮(公司称其为欧洲科技公司规模最大的股权轮,三星领投),Large 4 被官方定义为该轮资助路线图的开篇里程碑,算力扩张仍在欧洲自有数据中心推进。
三个待验证的判断
其一,「优于中国模型」目前没有给出可比基准与对象,属于发布会话术,独立榜单发布前不宜采信;其二,82% 漏洞修补的「同类最高」口径由厂商自评,评测集构成与对手模型版本尚待第三方复核;其三,权重许可未定,开源承诺兑现度是观察 Mistral 与开源社区关系走向的关键。可以确认的是:欧洲头部实验室用一次万亿参数发布证明了自己仍在前沿牌桌上,而 10 月底权重落地时的许可条款、以及独立基准的首批复核结果,将比发布会的口径更值得盯。官方及行业暂未披露更多细节,后续将持续跟进迭代动态。