榜单口径:LiveBench 测什么、成本怎么算
LiveBench 的核心卖点是防污染:题目持续更新(当前最新版本为 2026-06-25 发布),避免模型在训练数据里「背题」。榜单按八个维度打分:总体、推理、编码、智能体编码、数学、数据分析、语言、指令遵循,并提供一个对本横评至关重要的列——每成功任务成本(cost per successful task)。
「每成功任务成本」不是 API 单价,而是完成一次成功任务的实际花费,它同时吸收了单价与重试率两个因素:一个单价便宜但频繁失败重试的模型,实际成本会被自动抬升。这使它比裸价格表更接近智能体生产环境的真实账单。
本文全部分数取自 LiveBench 官网 2026 年 9 月中旬快照。注意各模型并非在同一算力档位比较:Anthropic 旗舰为 Max Effort,Meta Muse Spark 1.3 与 GPT-5.5 为 xHigh,Gemini 3.7 Flash 为 High。榜单显示的是各模型官方推荐档位下的成绩,跨档位比较需谨慎。第三方镜像(如 aib.vote)与官方快照存在 0.3–0.8 分的版本差异,本文一律以官方站为准。
主榜横评:总分、智能体编码与单任务成本
先看核心数据。下表列出官方榜单上总分 76 分以上的主要模型(按总分降序):
| 模型(档位) | 总体 | 智能体编码 | 推理 | 每成功任务成本 |
|---|---|---|---|---|
| Claude Fable 5.1(Max) | 83.4 | 66.1 | 91.7 | $1.212 |
| Claude Fable 5(Max) | 83.0 | 62.2 | 89.7 | $1.439 |
| GPT-6 Astra(Max) | 82.2 | 57.3 | 92.7 | $0.736 |
| Muse Spark 1.3(xHigh,开源权重) | 81.6 | 64.1 | 89.7 | $0.219 |
| GPT-5.6 Sol(Max) | 81.0 | 56.2 | 91.7 | $0.515 |
| GPT-5.5 Thinking(xHigh) | 80.2 | 54.0 | 89.7 | $0.435 |
| Claude 5 Opus Thinking(Max) | 80.1 | 65.2 | 91.2 | $0.699 |
| Kimi K3(开源权重) | 79.2 | 62.2 | 90.7 | $0.348 |
| Gemini 3.7 Flash(High) | 78.8 | 58.3 | 87.8 | $0.157 |
| Qwen 3.8 Max(开源权重) | 78.5 | 64.6 | 88.2 | $0.275 |
| Grok 4.6 | 78.0 | 57.0 | 90.5 | $0.207 |
| DeepSeek V4 Pro 0813(开源权重) | 77.4 | 54.9 | 85.8 | $0.044 |
| DeepSeek V4 Flash Vision Exp(开源权重) | 76.8 | 65.1 | 85.4 | $0.051 |
| Qwen 3.8 Flash Next(开源权重) | 76.2 | 61.6 | 87.4 | $0.042 |
其一:前六名总分挤在 3.3 分之内,头部差距进入「换版本就可能反转」的区间;其二:智能体编码单项在同分段内拉开 12 分(54.0–66.1),是分化最剧烈的列;其三:14 款模型的单任务成本横跨 28 倍($0.042 到 $1.212),而总分只横跨 7 分——成本轴的分辨率远高于能力轴。
成本分化:1.8 分之差与 5.5 倍价格
本期榜单最具讨论价值的对照,发生在榜首与第四名之间:
- Claude Fable 5.1:83.4 分,$1.212/任务
- Muse Spark 1.3:81.6 分,$0.219/任务
两者总分差 1.8 分(约 2%),单任务成本差约 5.5 倍。把这条关系换成工程语言:如果你把 Fable 5.1 换成 Muse Spark 1.3,每 1000 次任务可以省下约 993 美元,代价是总分回撤 1.8%。对于日均千次以上调用的生产负载,这笔账很难视而不见。
但反过来读同样成立:在需要峰值质量的场景(复杂重构、高 stakes 决策链),1.8 分的总体差距在长尾难题上可能被放大——榜单的均值分不区分「错得无关紧要」和「错得致命」。Muse Spark 1.3 在指令遵循(78.0)一项反而是全场前列,但在智能体编码(64.1)上仍落后 Fable 5.1 两分。所以合理的结论不是「谁替代谁」,而是「按任务的风险等级分流」:常规批处理用高性价比模型,关键路径保留旗舰档位。
智能体编码的背离:推理强不等于智能体强
把「推理」与「智能体编码」两列并排看,会出现几组刺眼的背离:
| 模型 | 推理 | 智能体编码 | 背离幅度 |
|---|---|---|---|
| GPT-6 Astra | 92.7(全场最高) | 57.3 | −35.4 |
| GPT-5.6 Sol | 91.7 | 56.2 | −35.5 |
| DeepSeek V4 Flash Vision Exp | 85.4 | 65.1 | +20.3(反超) |
| Qwen 3.8 Max | 88.2 | 64.6 | +23.6(反超) |
GPT-6 Astra 拿着全场最高的推理分,智能体编码却排不进前列;而两款开源权重模型推理分平平,智能体编码却挤进了旗舰梯队。这说明智能体编码测量的不是「会不会想」,而是「多步执行、调试与工具协作的循环质量」——它更依赖训练目标与智能体运行时的匹配度,而非纯粹的智力上限。
对使用智能体框架(如 Claude Code 这类 harness)的团队,这一列比总分更值得盯:harness 的价值恰恰在于把「会想但不会做」的模型差距补回来,但补的前提是底座模型的多步执行力不能太差。
开源权重梯队:性价比曲线的拐点
开源权重模型在本期榜单上完成了两组有标志意义的卡位:
- 质量卡位:Muse Spark 1.3(81.6)与 Kimi K3(79.2)把开源权重模型的总分上限推到了闭源中档区间;DeepSeek V4 Flash Vision Exp 的 65.1 智能体编码分甚至超过了 GPT-6 Astra 的 57.3。
- 成本卡位:Qwen 3.8 Flash Next($0.042)、DeepSeek V4 Pro($0.044)把「可用级智能体编码」的单任务成本压到旗舰的 1/27 到 1/29,虽然总分落后 7 分左右,但对容错率高的批量场景已经够用。
此外,Muse Spark 1.3 的发布策略值得单独记录:Meta 同时提供标准定价($1.25/$4.25 每百万 token)与极低的贡献者档($0.10/$0.20),后者以允许 Meta 用你的数据做训练为交换。对于处理客户数据的团队,这个档位在合规上不可用——便宜和合规在这里是二选一,选型时要把这条小字放进对比表。
开源权重模型已经不再只打「便宜」牌:Muse Spark 1.3 在 80 分档用 1/5.5 的价格提供 98% 的总分,DeepSeek 系在智能体编码单项反超推理更强的闭源模型。闭源旗舰的护城河正在收窄到长尾难题峰值质量与托管便利性两点。
代际对比:Fable 5.1 相对 Fable 5 的真实进步
同厂商代际对比是检验「旗舰溢价是否物有所值」的直观标尺:
| 维度 | Fable 5 | Fable 5.1 | 变化 |
|---|---|---|---|
| 总体 | 83.0 | 83.4 | +0.4 |
| 智能体编码 | 62.2 | 66.1 | +3.9 |
| 数学 | 96.0 | 97.0 | +1.0 |
| 每成功任务成本 | $1.439 | $1.212 | −16% |
总体分只涨了 0.4,但智能体编码涨了 3.9、成本降了 16%——「更贵能力」到「更值能力」的组合拳。这组数据也再次验证了一个规律:在头部竞争进入分毫之争的阶段,代际进步主要体现在专项列与成本列,而不是总分。总分驱动的选型方法在 2026 年已经不够用了。
口径警示与局限
- 档位不对齐:Max/xHigh/High 是各厂商推荐的算力档,比较的是「产品形态」而非「同等算力下的模型极限」。
- 快照时效:榜单每周更新,第三方镜像存在版本差异(如某镜像榜单与官方快照相差 0.3–0.8 分),引用时必须注明快照时间。
- 「成功任务」的定义:成本列依赖任务成功判定,失败重试计入成本,但「部分成功」如何计价官方未披露更多细节,后续将持续跟进迭代动态。
- 单一维度陷阱:智能体编码不等于全部智能体能力,工具调用、浏览器操作、长程任务各有专项基准,本文聚焦 LiveBench 口径,跨基准结论见本站 R-BENCH-10 对三基准等权体系的讨论。
- 商业口径:贡献者档等定价策略涉及数据授权条款,生产选型需核对最新官方条款。
分场景选型建议
| 场景 | 优先考虑 | 理由 |
|---|---|---|
| 大规模批量处理(容错可兜底) | DeepSeek V4 Pro / Qwen 3.8 Flash Next | $0.05 量级单任务成本,智能体编码 55 分上下,配合人工抽检足够 |
| 日常编码助手与常规自动化 | Muse Spark 1.3 / Gemini 3.7 Flash | 80 分档质量、$0.16–0.22 成本,性价比区间最优 |
| 智能体编码主力(harness 底座) | Fable 5.1 / Claude 5 Opus / DeepSeek V4 Flash | 智能体编码 65–66 梯队,多步执行力经过验证 |
| 高 stakes 关键路径 | Fable 5.1(Max) | 总分与数学、指令遵循的均衡峰值,长尾难题容错最低 |
| 数据敏感、需私有化部署 | Muse Spark 1.3 / Kimi K3 / Qwen 3.8 Max | 开源权重可自托管,规避贡献者档数据授权问题,边际成本趋近 GPU 折旧 |
一句话收束:当能力轴挤进同分段,成本轴与专项轴的分辨率才是选型的有效坐标系。LiveBench 这一期榜单最大的价值,不是告诉你谁是榜首,而是把「每成功任务成本」放到了与分数同等显眼的位置——这是榜单设计对行业认知的一次纠偏。