能力评测 2026-09-20 24 分钟阅读 通用

LiveBench 2026 年 9 月横评:80 分档里藏着 5.5 倍的单任务成本差

当总分只差 1.8 分的两款模型,每次成功任务的成本相差 0.99 美元 — 智能体选型的主导变量正在换人

摘要

本文基于 LiveBench 官方 2026 年 9 月榜单做一次聚焦「智能体编码」与「成本效率」的横评。数据显示:榜首 Claude Fable 5.1(83.4 分,1.21 美元/任务)与 Meta Muse Spark 1.3(81.6 分,0.22 美元/任务)总分相差 1.8 分,单任务成本却相差约 5.5 倍;而智能体编码单项上,开源权重模型 Qwen 3.8 Max(64.6)与 DeepSeek V4 Flash Vision(65.1)已进入与闭源旗舰同一梯队。总分趋同、成本分化、单项背离,是这一期榜单给出的三个结构性信号。

榜单口径:LiveBench 测什么、成本怎么算

LiveBench 的核心卖点是防污染:题目持续更新(当前最新版本为 2026-06-25 发布),避免模型在训练数据里「背题」。榜单按八个维度打分:总体、推理、编码、智能体编码、数学、数据分析、语言、指令遵循,并提供一个对本横评至关重要的列——每成功任务成本(cost per successful task)

「每成功任务成本」不是 API 单价,而是完成一次成功任务的实际花费,它同时吸收了单价与重试率两个因素:一个单价便宜但频繁失败重试的模型,实际成本会被自动抬升。这使它比裸价格表更接近智能体生产环境的真实账单。

⚠️ 数据声明

本文全部分数取自 LiveBench 官网 2026 年 9 月中旬快照。注意各模型并非在同一算力档位比较:Anthropic 旗舰为 Max Effort,Meta Muse Spark 1.3 与 GPT-5.5 为 xHigh,Gemini 3.7 Flash 为 High。榜单显示的是各模型官方推荐档位下的成绩,跨档位比较需谨慎。第三方镜像(如 aib.vote)与官方快照存在 0.3–0.8 分的版本差异,本文一律以官方站为准。

主榜横评:总分、智能体编码与单任务成本

先看核心数据。下表列出官方榜单上总分 76 分以上的主要模型(按总分降序):

模型(档位) 总体 智能体编码 推理 每成功任务成本
Claude Fable 5.1(Max) 83.4 66.1 91.7 $1.212
Claude Fable 5(Max) 83.0 62.2 89.7 $1.439
GPT-6 Astra(Max) 82.2 57.3 92.7 $0.736
Muse Spark 1.3(xHigh,开源权重) 81.6 64.1 89.7 $0.219
GPT-5.6 Sol(Max) 81.0 56.2 91.7 $0.515
GPT-5.5 Thinking(xHigh) 80.2 54.0 89.7 $0.435
Claude 5 Opus Thinking(Max) 80.1 65.2 91.2 $0.699
Kimi K3(开源权重) 79.2 62.2 90.7 $0.348
Gemini 3.7 Flash(High) 78.8 58.3 87.8 $0.157
Qwen 3.8 Max(开源权重) 78.5 64.6 88.2 $0.275
Grok 4.6 78.0 57.0 90.5 $0.207
DeepSeek V4 Pro 0813(开源权重) 77.4 54.9 85.8 $0.044
DeepSeek V4 Flash Vision Exp(开源权重) 76.8 65.1 85.4 $0.051
Qwen 3.8 Flash Next(开源权重) 76.2 61.6 87.4 $0.042
📊 三个结构性信号

其一:前六名总分挤在 3.3 分之内,头部差距进入「换版本就可能反转」的区间;其二:智能体编码单项在同分段内拉开 12 分(54.0–66.1),是分化最剧烈的列;其三:14 款模型的单任务成本横跨 28 倍($0.042 到 $1.212),而总分只横跨 7 分——成本轴的分辨率远高于能力轴。

成本分化:1.8 分之差与 5.5 倍价格

本期榜单最具讨论价值的对照,发生在榜首与第四名之间:

两者总分差 1.8 分(约 2%),单任务成本差约 5.5 倍。把这条关系换成工程语言:如果你把 Fable 5.1 换成 Muse Spark 1.3,每 1000 次任务可以省下约 993 美元,代价是总分回撤 1.8%。对于日均千次以上调用的生产负载,这笔账很难视而不见。

但反过来读同样成立:在需要峰值质量的场景(复杂重构、高 stakes 决策链),1.8 分的总体差距在长尾难题上可能被放大——榜单的均值分不区分「错得无关紧要」和「错得致命」。Muse Spark 1.3 在指令遵循(78.0)一项反而是全场前列,但在智能体编码(64.1)上仍落后 Fable 5.1 两分。所以合理的结论不是「谁替代谁」,而是「按任务的风险等级分流」:常规批处理用高性价比模型,关键路径保留旗舰档位。

智能体编码的背离:推理强不等于智能体强

把「推理」与「智能体编码」两列并排看,会出现几组刺眼的背离:

模型 推理 智能体编码 背离幅度
GPT-6 Astra 92.7(全场最高) 57.3 −35.4
GPT-5.6 Sol 91.7 56.2 −35.5
DeepSeek V4 Flash Vision Exp 85.4 65.1 +20.3(反超)
Qwen 3.8 Max 88.2 64.6 +23.6(反超)

GPT-6 Astra 拿着全场最高的推理分,智能体编码却排不进前列;而两款开源权重模型推理分平平,智能体编码却挤进了旗舰梯队。这说明智能体编码测量的不是「会不会想」,而是「多步执行、调试与工具协作的循环质量」——它更依赖训练目标与智能体运行时的匹配度,而非纯粹的智力上限。

对使用智能体框架(如 Claude Code 这类 harness)的团队,这一列比总分更值得盯:harness 的价值恰恰在于把「会想但不会做」的模型差距补回来,但补的前提是底座模型的多步执行力不能太差。

开源权重梯队:性价比曲线的拐点

开源权重模型在本期榜单上完成了两组有标志意义的卡位:

此外,Muse Spark 1.3 的发布策略值得单独记录:Meta 同时提供标准定价($1.25/$4.25 每百万 token)与极低的贡献者档($0.10/$0.20),后者以允许 Meta 用你的数据做训练为交换。对于处理客户数据的团队,这个档位在合规上不可用——便宜和合规在这里是二选一,选型时要把这条小字放进对比表。

💡 关键发现

开源权重模型已经不再只打「便宜」牌:Muse Spark 1.3 在 80 分档用 1/5.5 的价格提供 98% 的总分,DeepSeek 系在智能体编码单项反超推理更强的闭源模型。闭源旗舰的护城河正在收窄到长尾难题峰值质量托管便利性两点。

代际对比:Fable 5.1 相对 Fable 5 的真实进步

同厂商代际对比是检验「旗舰溢价是否物有所值」的直观标尺:

维度 Fable 5 Fable 5.1 变化
总体 83.0 83.4 +0.4
智能体编码 62.2 66.1 +3.9
数学 96.0 97.0 +1.0
每成功任务成本 $1.439 $1.212 −16%

总体分只涨了 0.4,但智能体编码涨了 3.9、成本降了 16%——「更贵能力」到「更值能力」的组合拳。这组数据也再次验证了一个规律:在头部竞争进入分毫之争的阶段,代际进步主要体现在专项列与成本列,而不是总分。总分驱动的选型方法在 2026 年已经不够用了。

口径警示与局限

分场景选型建议

场景 优先考虑 理由
大规模批量处理(容错可兜底) DeepSeek V4 Pro / Qwen 3.8 Flash Next $0.05 量级单任务成本,智能体编码 55 分上下,配合人工抽检足够
日常编码助手与常规自动化 Muse Spark 1.3 / Gemini 3.7 Flash 80 分档质量、$0.16–0.22 成本,性价比区间最优
智能体编码主力(harness 底座) Fable 5.1 / Claude 5 Opus / DeepSeek V4 Flash 智能体编码 65–66 梯队,多步执行力经过验证
高 stakes 关键路径 Fable 5.1(Max) 总分与数学、指令遵循的均衡峰值,长尾难题容错最低
数据敏感、需私有化部署 Muse Spark 1.3 / Kimi K3 / Qwen 3.8 Max 开源权重可自托管,规避贡献者档数据授权问题,边际成本趋近 GPU 折旧

一句话收束:当能力轴挤进同分段,成本轴与专项轴的分辨率才是选型的有效坐标系。LiveBench 这一期榜单最大的价值,不是告诉你谁是榜首,而是把「每成功任务成本」放到了与分数同等显眼的位置——这是榜单设计对行业认知的一次纠偏。

核心发现

参考来源

  1. LiveBench — 官方榜单快照(livebench.ai,2026-06-25 版本,2026 年 9 月中旬数据)
  2. Stack Futures — LiveBench September 2026: Fable 5.1 Leads at 83.4, Muse Spark 1.3 Scores 81.6 at $0.22 per Task(2026.09)
  3. Dapols — AI 模型追踪库:LiveBench 2026-09-06 快照与各模型定价卡(2026.09)
  4. AIB.vote — LiveBench Overall 镜像榜单(用于快照差异交叉核对,本文以官方站为准)
  5. Artificial Analysis — Coding Agent Index 与 Muse Spark 1.3 定价数据(2026.09)