一份持续刷新的开源成绩单

9 月 22 日,小米正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 与 Flash 两款原生全模态模型。官方把这轮更新称作探索 RSI(递归自我改进)路径的关键一步:通过规模化扩展强化学习算力,让模型在持续探索与反馈中拓展智能边界。

先看榜单。MiMo-V2.6-Pro 在 Artificial Analysis 综合智能指数中拿到 46 分,超过 Kimi K3 与 Qwen3.8 Max,在当前开源模型中排在首位;同时官方也把话说得比较直——与 Claude Fable 5.1、GPT-6 Astra 等闭源旗舰相比仍有差距。「开源内部拉开身位、面对闭源仍有距离」,这样的双面表述,比单纯的跑分海报更有信息量。

不到六天的 RL 冲刺:钱花在哪里

训练侧的数字值得展开。Pro 与 Flash 的强化学习训练都历时不到六天,成本分别约 262 万美元与 85 万美元,各完成 30 步训练,累计约 75 万条轨迹;训练任务的平均通过率分别提升 25% 与 12%。在长程软件工程评测 DeepSWE v1.1 上,Pro 从 58.4 提升到 72.57,Flash 从 48.8 提升到 65.68。

工程配置上,训练采用 1568 个样本的大批量设置,支持 1M 上下文,单步训练 Token 量达 27 亿至 37 亿。对国内开源阵营来说,这大概是在强化学习算力上投入最多的尝试之一——它给出的参照系不是「更大的预训练」,而是「更贵的后训练」。

长程软件工程评测 DeepSWE v1.1:一轮 RL 的变化Pro58.472.57Flash48.865.68RL 训练均不足 6 天 · 成本约 262 万 / 85 万美元 · 各 30 步 · 累计约 75 万条轨迹
MiMo-V2.6 在 DeepSWE v1.1 上的提升(浅色=训练前,深色=训练后)

全模态不止「看图说话」

能力面上,MiMo-V2.6 融合了 3D 空间推理、多模态感知与计算机操作:可以从自然语言生成 3D 开放世界游戏、在 Blender 中完成建模,也能控制机械臂完成抓取任务。科研场景里有两条可验证的记录——协助完成 MOF 材料的设计筛选,以及在 Lean 4 中完成 Li-Yorke 定理的完整形式化,形成 6000 余行源码。

在偏设计能力的 Design Arena 评测中,MiMo-V2.6-Pro 达到与 Claude Opus 5、GPT-5.6 Sol 相近的水平。全模态加操作能力的组合,指向的显然不只是聊天窗口,而是「能看、能建、能操作」的通用底座叙事。

价格锚点与桌面端

定价方面,MiMo-V2.6 沿用 V2.5 系列的价格,官方称在同等智能水平下价格约为海外模型的二十分之一到六十分之一;API 价格维持不变。桌面端 MiMo Desktop 客户端与会员订阅同步上线,Pro 档提供 UltraSpeed 超高速模式,输出速度最高可达 20 倍。

「性能对齐、价格错位」是国内模型厂商反复使用的一招,小米这次把锚点画得更清楚:同样的智能水平,用一到两个数量级的价格差去承接开发者与中小企业的预算。

开源礼包的分量,与需要冷静的地方

开源侧,小米放出了 Pro 与 Flash 的完整权重与技术报告,并附带 MiMo-V2.6-Distill-Qwen-9B 蒸馏模型、7000 多条高质量 RL 任务环境与端到端 RL 训练框架。对想复现后训练流程的团队来说,这套「权重加任务环境加训练框架」的组合,比单发权重更有诚意。

需要冷静看的地方也有两点:其一,榜单分差来自评测机构的综合口径,与真实业务表现之间始终有距离;其二,用 RL 算力堆出来的提升能否被中小团队复制,取决于任务环境与算力预算,这两样恰恰是多数团队缺的。开源礼包补上了前者的一半,后者仍要自己想办法。