能力评测 2026-10-10 25 分钟阅读 进阶

Reflection Beam 501B 自报横评:西方开源权重模型的编码智能体基准答卷

501B 总参 / 23B 激活对阵中式梯队 — 能力差距真实存在,效率叙事如何接棒

摘要

2026 年 10 月 5 日,Nvidia 系创业公司 Reflection AI 发布其首款开放权重模型 Beam:稀疏 MoE 架构、501B 总参数、23B 激活、文本模态、1M 有效上下文,专为编码、推理与智能体负载训练。预训练用 23.8 万亿 token 与 6144 块 GB300 GPU;强化学习阶段动用 10500 块 GB300 跑满四周、生成超 1 亿次 rollout。在它自己给出的基准表里,Beam 对阵的是清一色中国开源模型——GLM 5.2/5.3、Kimi K3、Qwen 3.8 Max、DeepSeek V4.1 Flash,外加西方对照 Inkling 与 Nemotron 3 Ultra。结论的两面都很清楚:编码与终端任务上 Beam 与 GLM 5.2 互有胜负、在难度更高的套件上明显落后;工具调用与搜索维度同样落后于中式梯队头部。Reflection 不回避这些数字,把叙事押在「每 token 智能密度」上——对比 GLM 5.2 少用 3 到 4 倍推理算力。需要反复强调的是:全部数字为厂商自报、对照分数来自第三方聚合、权重本月底才放出,目前不存在任何独立复现。本文逐榜拆解这份答卷,并给出读表时应保留的口径警示。

西方开源权重缺位的 2026 与 Beam 的卡位

2026 年开源权重模型的前沿长期由中国实验室定义:智谱的 GLM 系列、月之暗面的 Kimi K3、阿里的 Qwen 3.8 Max、DeepSeek 的 V4 系列,构成了事实上的对比基准集。美国实验室大多把旗舰模型锁在 API 之后,开源权重赛道存在明显的「西方缺位」。Reflection AI 的成立宗旨恰好瞄准这个位置——为不愿或无法使用中国开源模型的企业与政府机构提供美制开放模型选项,媒体已经开始用「美版 DeepSeek」称呼它(这一标签来自媒体叙事而非官方自称,读时需保持距离)。

Beam 的资本背景决定了它可以玩长期游戏:据 TechCrunch 引用 PitchBook,公司累计融资约 47 亿美元,最近一轮投前估值 250 亿美元;2026 年夏天与 SpaceX 和 Nebius 签下合计超 70 亿美元的算力合同,锁定 2029 年前的 GB300 芯片供应。这些数字与基准表放在一起看才有意义——这是一家把算力当作核心资产的公司交出的阶段答卷。

发布状态需要先说清楚:Beam 仍在最终红队测试与评估中,权重、技术报告、模型卡与开发者工具链计划于本月晚些时候发布(Apache 2.0 许可为官方口径),API 走候补名单、定价未公布。本文全部数据点均出自 Reflection 自报的发布表,权重尚不可下载,无任何独立复现——这是读完全文都必须带着的前提。

🎯 一句话定位

Beam 的基准表没有试图掩盖能力差距——Reflection 明说 Kimi K3 等模型在原始能力上保持领先——而是把叙事押在推理时效率上:对标 GLM 5.2 的推理成绩,只花 3 到 4 分之一到 4 分之一的推理算力。能力追平是承诺,效率优势是当下的可检验主张。

参数规格与训练投入:501B 之外的三组关键数字

Beam 是文本模态的稀疏 MoE 模型:总参数 501B、每 token 激活 23B(API 名称 Beam-501B-A23B)、1M 有效上下文,预训练消耗 23.8 万亿 token,用 6144 块 NVIDIA GB300 在四周内完成。强化学习阶段是它叙事里最重的部分:10500 块 GB300 连续四周、产生超 1 亿次 rollout——Reflection 称这是开源实验室尝试过的较大规模 RL 运行之一。安全侧,团队从预训练检查点单独训练安全对齐教师,再用多教师在线策略蒸馏与 RL 教师合并,安全训练采用 deliberative alignment,完整安全评估留待技术报告。

对比集的参数规格让 Beam 的「小」更加突出。以下是 aiincontext 整理的横向规格表(对照模型数据来源包括各厂商公开资料):

模型 开发方 总参数 激活参数 权重状态
Beam Reflection AI(美国) 501B 23B 本月晚些时候(Apache 2.0 计划)
GLM-5.2 Z.ai(中国) 约 753B 约 40B 已开放(MIT)
Nemotron 3 Ultra NVIDIA(美国) 550B 55B 已开放(OpenMDW-1.1)
DeepSeek V4.1 Flash DeepSeek(中国) 552B 骨干 + 196B Engram 8B 预填充 / 16B 解码 已开放(MIT)
Kimi K3 月之暗面(中国) 2.8T 104B 已开放(定制许可,超大产品需署名)

在这组对照里,Beam 是总参数较小的一款,23B 的激活量也低于 GLM-5.2、Nemotron 3 Ultra 与 Kimi K3。这既是效率主张的来源,也是能力差距的结构性原因——参数预算的取舍在发布前就已经写进了基准表的形状里。

编码与终端八榜:互有胜负与真实差距

编码与终端任务是 Beam 训练的重点方向,也是其基准表的开篇组别。下表整理自 Reflection 官方发布表(NR = 该模型未报告此榜;Beam 数据为自报,对照分数来源为 Artificial Analysis 与 DataCurve 的聚合口径):

基准 Beam Inkling Nemotron 3 Ultra GLM 5.2 GLM 5.3 Kimi K3 Qwen 3.8 Max DeepSeek V4.1 Flash
SWE-bench Verified 80.9 77.6 70.7 NR NR NR NR NR
SWE-bench Multilingual 78.0 NR 67.7 NR NR NR NR NR
SWE-bench Pro v1 65.5 54.3 46.4 62.1 NR NR 67.7 NR
SWE-bench Pro v2-Hard 77.2 56.9 NR NR 84.3 88.2 NR NR
Terminal-Bench v2.1 80.1 63.8 56.4 81.0 88.2 88.3 86.6 90.6
DeepSWE v1.1 44.4 NR NR 44.0 61.0 68.0 51.0 74.2
SWE Atlas Codebase QnA 34.6 NR NR 61.0 68.0 NR NR NR

这组表的三层读法:

工具调用与搜索:落后更明显的一半

对智能体负载而言,工具调用与搜索维度比纯编码更能说明部署价值——而这恰是 Beam 相对落后更明显的组别:

基准 Beam Inkling GLM 5.2 GLM 5.3 Kimi K3 Qwen 3.8 Max DeepSeek V4.1 Flash
MCP Atlas(工具调用) 78.7 76.0 77.8 84.2 82.3 84.5 NR
BrowseComp(含上下文管理) 77.4 77.1 NR NR 91.2 NR NR
DeepSearchQA 80.1 NR NR NR 95.0 NR NR
AutomationBench 37.0 NR 26.2 NR NR NR 54.8
tau3(银行场景) 38.0 NR NR NR NR 55.2 NR

MCP Atlas 上 Beam 与 GLM 5.2 互有胜负(78.7 对 77.8),但落后 GLM 5.3(84.2)与 Qwen 3.8 Max(84.5)约 6 分;BrowseComp 与 DeepSearchQA 对 Kimi K3 的差距达到 14 到 15 分;自动化与金融场景(AutomationBench、tau3)同样落后 DeepSeek V4.1 Flash 与 Qwen 3.8 Max。aitoolsreview 的概括比较直白:如果要做浏览与研究型智能体,当前开源头部明显领先;如果要一台便宜耐用的编码主力机,Beam 的理由更充分。

推理与通用能力:中游水平

基准 Beam Inkling GLM 5.2 GLM 5.3 Kimi K3 Qwen 3.8 Max DeepSeek V4.1 Flash
AIME 2026 97.8 97.1 99.2 NR NR NR NR
HLE(无工具) 36.2 29.7 40.5 42.3 46.9 43.6 39.1
GPQA Diamond 90.5 87.2 91.2 91.7 93.5 92.6 90.9
SciCode 49.7 46.1 NR 59.0 58.7 52.1 52.0

推理组的表现印证了 Reflection 自己的定位表述:GPQA Diamond 90.5 与 GLM 5.2、DeepSeek V4.1 Flash 相差不到一分;但 HLE 无工具 36.2 低于所有报告了分数的中国对照模型。综合三组表,Beam 的能力画像可以概括为:编码主力可以胜任,浏览研究明显落后,推理处于中游。

效率叙事:3 到 4 倍算力差的读法

Reflection 的核心主张是:在高级推理基准上达到与 GLM 5.2 相当的成绩,同时推理算力少用 3 到 4 倍;对 2T 级总参数的模型(如 Qwen 3.8 Max),效率差距更大。官方还提到用户可以用推理力度(reasoning-effort)参数在响应长度与性能之间权衡。

这个主张的合理性有结构支撑:23B 激活天然意味着更少的每 token 计算量,稀疏 MoE 的服务成本主要由激活参数与内存带宽决定。但它目前的形态只是算术推算 + 厂商声明:没有公开的每 token 延迟、吞吐或每百万 token 成本数据,API 定价未公布,独立基准不存在。在权重发布、第三方跑出服务侧实测之前,「3 到 4 倍效率」应被视为待验证假设而非结论。

📐 效率主张的检验清单

权重发布后,三个数字能把效率叙事变成可检验命题:其一,公开定价与每百万 token 成本;其二,第三方在同等硬件上的吞吐/延迟实测;其三,在相同 Harness(如统一编码智能体环境)下与 GLM 5.2、DeepSeek V4.1 Flash 的成本口径对比——模型层分数差异不等于部署成本差异,这是本站 R-BENCH-28 反复强调的口径。

自报口径与未验证边界

把 Beam 放回本站评测线脉络:R-BENCH-28 的 Terminal-Bench 4.0 快照论证了 harness 与模型的权重之辨,R-BENCH-30 的 Hermes Index 给每一分标了价。Beam 的基准表属于模型层答卷,它与前两者的接口是明确的:当 Apache 2.0 权重落地,把它塞进统一 harness 跑一轮成本口径的横评,才是检验「每 token 智能密度」叙事的正确方式。权重发布、定价公布与独立复现是三个值得跟踪的节点。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

核心发现

参考来源

  1. Reflection AI — Introducing Beam: Reflection's 501B open-weight model(官方发布文,2026.10.05)
  2. AI Tools Review — Reflection Beam 501B: Specs, Benchmarks & Verdict(2026.10)
  3. aiincontext — Reflection AI Beam: 501B MoE Model for Agentic Coding(2026.10)
  4. 钜亨网 — 「美版 Deepseek」交答卷 Reflection AI 发表首款开放权重模型(2026.10)
  5. narracomm — Reflection Introduces Beam, a 501B Open-Weight Model, Apache 2.0 Weights Later This Month(2026.10.08)
  6. sakutto.ai — Reflection Beam is a 501B open-weight MoE model(2026.10)