西方开源权重缺位的 2026 与 Beam 的卡位
2026 年开源权重模型的前沿长期由中国实验室定义:智谱的 GLM 系列、月之暗面的 Kimi K3、阿里的 Qwen 3.8 Max、DeepSeek 的 V4 系列,构成了事实上的对比基准集。美国实验室大多把旗舰模型锁在 API 之后,开源权重赛道存在明显的「西方缺位」。Reflection AI 的成立宗旨恰好瞄准这个位置——为不愿或无法使用中国开源模型的企业与政府机构提供美制开放模型选项,媒体已经开始用「美版 DeepSeek」称呼它(这一标签来自媒体叙事而非官方自称,读时需保持距离)。
Beam 的资本背景决定了它可以玩长期游戏:据 TechCrunch 引用 PitchBook,公司累计融资约 47 亿美元,最近一轮投前估值 250 亿美元;2026 年夏天与 SpaceX 和 Nebius 签下合计超 70 亿美元的算力合同,锁定 2029 年前的 GB300 芯片供应。这些数字与基准表放在一起看才有意义——这是一家把算力当作核心资产的公司交出的阶段答卷。
发布状态需要先说清楚:Beam 仍在最终红队测试与评估中,权重、技术报告、模型卡与开发者工具链计划于本月晚些时候发布(Apache 2.0 许可为官方口径),API 走候补名单、定价未公布。本文全部数据点均出自 Reflection 自报的发布表,权重尚不可下载,无任何独立复现——这是读完全文都必须带着的前提。
Beam 的基准表没有试图掩盖能力差距——Reflection 明说 Kimi K3 等模型在原始能力上保持领先——而是把叙事押在推理时效率上:对标 GLM 5.2 的推理成绩,只花 3 到 4 分之一到 4 分之一的推理算力。能力追平是承诺,效率优势是当下的可检验主张。
参数规格与训练投入:501B 之外的三组关键数字
Beam 是文本模态的稀疏 MoE 模型:总参数 501B、每 token 激活 23B(API 名称 Beam-501B-A23B)、1M 有效上下文,预训练消耗 23.8 万亿 token,用 6144 块 NVIDIA GB300 在四周内完成。强化学习阶段是它叙事里最重的部分:10500 块 GB300 连续四周、产生超 1 亿次 rollout——Reflection 称这是开源实验室尝试过的较大规模 RL 运行之一。安全侧,团队从预训练检查点单独训练安全对齐教师,再用多教师在线策略蒸馏与 RL 教师合并,安全训练采用 deliberative alignment,完整安全评估留待技术报告。
对比集的参数规格让 Beam 的「小」更加突出。以下是 aiincontext 整理的横向规格表(对照模型数据来源包括各厂商公开资料):
| 模型 | 开发方 | 总参数 | 激活参数 | 权重状态 |
|---|---|---|---|---|
| Beam | Reflection AI(美国) | 501B | 23B | 本月晚些时候(Apache 2.0 计划) |
| GLM-5.2 | Z.ai(中国) | 约 753B | 约 40B | 已开放(MIT) |
| Nemotron 3 Ultra | NVIDIA(美国) | 550B | 55B | 已开放(OpenMDW-1.1) |
| DeepSeek V4.1 Flash | DeepSeek(中国) | 552B 骨干 + 196B Engram | 8B 预填充 / 16B 解码 | 已开放(MIT) |
| Kimi K3 | 月之暗面(中国) | 2.8T | 104B | 已开放(定制许可,超大产品需署名) |
在这组对照里,Beam 是总参数较小的一款,23B 的激活量也低于 GLM-5.2、Nemotron 3 Ultra 与 Kimi K3。这既是效率主张的来源,也是能力差距的结构性原因——参数预算的取舍在发布前就已经写进了基准表的形状里。
编码与终端八榜:互有胜负与真实差距
编码与终端任务是 Beam 训练的重点方向,也是其基准表的开篇组别。下表整理自 Reflection 官方发布表(NR = 该模型未报告此榜;Beam 数据为自报,对照分数来源为 Artificial Analysis 与 DataCurve 的聚合口径):
| 基准 | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| SWE-bench Verified | 80.9 | 77.6 | 70.7 | NR | NR | NR | NR | NR |
| SWE-bench Multilingual | 78.0 | NR | 67.7 | NR | NR | NR | NR | NR |
| SWE-bench Pro v1 | 65.5 | 54.3 | 46.4 | 62.1 | NR | NR | 67.7 | NR |
| SWE-bench Pro v2-Hard | 77.2 | 56.9 | NR | NR | 84.3 | 88.2 | NR | NR |
| Terminal-Bench v2.1 | 80.1 | 63.8 | 56.4 | 81.0 | 88.2 | 88.3 | 86.6 | 90.6 |
| DeepSWE v1.1 | 44.4 | NR | NR | 44.0 | 61.0 | 68.0 | 51.0 | 74.2 |
| SWE Atlas Codebase QnA | 34.6 | NR | NR | 61.0 | 68.0 | NR | NR | NR |
这组表的三层读法:
- 对西方对照赢面明显:SWE-bench Verified 80.9 对 Inkling 77.6、Nemotron 3 Ultra 70.7;多语言榜 78.0 对 Nemotron 67.7。在「西方开源权重」的内部比较里,Beam 确实推进了这个梯队的上限。
- 与 GLM 5.2 互有胜负:Terminal-Bench 80.1 对 81.0 基本持平;SWE-bench Pro v1 65.5 对 62.1 小胜;DeepSWE 44.4 对 44.0 打平;但 SWE Atlas 代码库问答 34.6 对 61.0 差距接近一倍。
- 对中式梯队头部差距真实:Terminal-Bench 上 DeepSeek V4.1 Flash 90.6、Kimi K3 88.3,比 Beam 高约 8 到 10 分;DeepSWE 差距更大——DeepSeek V4.1 Flash 74.2 对 Beam 44.4,差近 30 分。值得注意的是,这个差距的最大贡献者是 DeepSeek 的 Flash 档模型——一家以效率见长的实验室用轻量档位同时赢了能力和效率,这对 Beam「以效率换位置」的叙事构成直接压力。
工具调用与搜索:落后更明显的一半
对智能体负载而言,工具调用与搜索维度比纯编码更能说明部署价值——而这恰是 Beam 相对落后更明显的组别:
| 基准 | Beam | Inkling | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|
| MCP Atlas(工具调用) | 78.7 | 76.0 | 77.8 | 84.2 | 82.3 | 84.5 | NR |
| BrowseComp(含上下文管理) | 77.4 | 77.1 | NR | NR | 91.2 | NR | NR |
| DeepSearchQA | 80.1 | NR | NR | NR | 95.0 | NR | NR |
| AutomationBench | 37.0 | NR | 26.2 | NR | NR | NR | 54.8 |
| tau3(银行场景) | 38.0 | NR | NR | NR | NR | 55.2 | NR |
MCP Atlas 上 Beam 与 GLM 5.2 互有胜负(78.7 对 77.8),但落后 GLM 5.3(84.2)与 Qwen 3.8 Max(84.5)约 6 分;BrowseComp 与 DeepSearchQA 对 Kimi K3 的差距达到 14 到 15 分;自动化与金融场景(AutomationBench、tau3)同样落后 DeepSeek V4.1 Flash 与 Qwen 3.8 Max。aitoolsreview 的概括比较直白:如果要做浏览与研究型智能体,当前开源头部明显领先;如果要一台便宜耐用的编码主力机,Beam 的理由更充分。
推理与通用能力:中游水平
| 基准 | Beam | Inkling | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|
| AIME 2026 | 97.8 | 97.1 | 99.2 | NR | NR | NR | NR |
| HLE(无工具) | 36.2 | 29.7 | 40.5 | 42.3 | 46.9 | 43.6 | 39.1 |
| GPQA Diamond | 90.5 | 87.2 | 91.2 | 91.7 | 93.5 | 92.6 | 90.9 |
| SciCode | 49.7 | 46.1 | NR | 59.0 | 58.7 | 52.1 | 52.0 |
推理组的表现印证了 Reflection 自己的定位表述:GPQA Diamond 90.5 与 GLM 5.2、DeepSeek V4.1 Flash 相差不到一分;但 HLE 无工具 36.2 低于所有报告了分数的中国对照模型。综合三组表,Beam 的能力画像可以概括为:编码主力可以胜任,浏览研究明显落后,推理处于中游。
效率叙事:3 到 4 倍算力差的读法
Reflection 的核心主张是:在高级推理基准上达到与 GLM 5.2 相当的成绩,同时推理算力少用 3 到 4 倍;对 2T 级总参数的模型(如 Qwen 3.8 Max),效率差距更大。官方还提到用户可以用推理力度(reasoning-effort)参数在响应长度与性能之间权衡。
这个主张的合理性有结构支撑:23B 激活天然意味着更少的每 token 计算量,稀疏 MoE 的服务成本主要由激活参数与内存带宽决定。但它目前的形态只是算术推算 + 厂商声明:没有公开的每 token 延迟、吞吐或每百万 token 成本数据,API 定价未公布,独立基准不存在。在权重发布、第三方跑出服务侧实测之前,「3 到 4 倍效率」应被视为待验证假设而非结论。
权重发布后,三个数字能把效率叙事变成可检验命题:其一,公开定价与每百万 token 成本;其二,第三方在同等硬件上的吞吐/延迟实测;其三,在相同 Harness(如统一编码智能体环境)下与 GLM 5.2、DeepSeek V4.1 Flash 的成本口径对比——模型层分数差异不等于部署成本差异,这是本站 R-BENCH-28 反复强调的口径。
自报口径与未验证边界
- 全部自报:Beam 的所有分数来自 Reflection 自己的评估,对照模型分数来自 Artificial Analysis 与 DataCurve 的聚合——两套来源的评测配置是否完全一致,发布表未做说明。TechCrunch 明确指出官方数据尚未经第三方独立机构验证。
- 大量 NR 空格:对照表中多个关键格子未报告(如 GLM 5.2/Kimi K3 在 SWE-bench Verified 上均 NR),跨榜比较时「 Beam 领先」的榜单往往恰是对照模型缺席的榜单——这未必是刻意选择,但读表时必须逐格核对。
- 权重未发布:Apache 2.0 权重「本月晚些时候」兑现与否是最大的开放项;在此之前,任何结论都建立在发布表之上。
- 安全评估缺席:deliberative alignment 与多教师蒸馏的方法描述了,但完整安全评估结果未随发布公告给出,对倾向自托管的企业用户这是必答题。
- 「美版 DeepSeek」标签的压力测试:DeepSeek V4.1 Flash 以轻量档位在 DeepSWE(74.2 对 44.4)与 Terminal-Bench(90.6 对 80.1)同时领先,说明效率与能力并非只能选一头——Beam 要证明的是自己的效率主张能在「不输太多」的前提下成立,而这个前提在部分榜单上尚未达成。
把 Beam 放回本站评测线脉络:R-BENCH-28 的 Terminal-Bench 4.0 快照论证了 harness 与模型的权重之辨,R-BENCH-30 的 Hermes Index 给每一分标了价。Beam 的基准表属于模型层答卷,它与前两者的接口是明确的:当 Apache 2.0 权重落地,把它塞进统一 harness 跑一轮成本口径的横评,才是检验「每 token 智能密度」叙事的正确方式。权重发布、定价公布与独立复现是三个值得跟踪的节点。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。