能力评测 2026-10-03 20 分钟阅读 入门

编码智能体六榜快照:六张榜单,三个榜首

LMArena × CursorBench × Artificial Analysis × Vals AI × LiveBench 十月横向比对 — 榜首分裂背后的口径断层线

摘要

「哪个模型编码能力更强」是采购与选型中最常被问、也最不该用单榜回答的问题。本文取 2026 年 10 月 3 日前后六张主流榜单的快照——LMArena Code、LMArena Agent、CursorBench v4.0、Artificial Analysis Intelligence Index、Vals AI 与 LiveBench——做横向比对:六张榜单的榜首完全分裂为三款模型(Opus 5.5、Fable 5.1、Gemini 4 Argon),而同一款模型在不同榜间的位次差可达十余名。本文拆解分歧背后的方法论断层线,并给出三条阅读与选型建议。数据为聚合镜像快照,Elo 类榜单随对局持续波动,具体分数仅代表抓取时点。

为什么是这六张榜:方法论谱系

本文选定的六张榜覆盖了当前模型层评测的四种主流方法论,且全部公开可查。需要先划清一个边界:本篇比的是模型层的六张榜单,而非 Harness/智能体产品层的执行式评测(如 DeepSWE、Terminal-Bench 那类带脚手架的对比,本站此前已有多篇专文覆盖)。模型层榜单回答的是「底座模型编码能力如何」,与最终智能体产品的表现之间还隔着 Harness 这一变量。

榜单 方法论 指标 收录模型数
LMArena Code 人类盲测对战(编码场景) Coding Elo 52
LMArena Agent 人类盲测对战(真实智能体编码会话) Agent Score 35
CursorBench v4.0 厂商自建智能体编码基准(通过率) Pass rate % 12
Artificial Analysis 独立综合智能指数 Intelligence Index 98
Vals AI 独立评测:软件/金融/网络安全真实任务 Accuracy % 30
LiveBench 抗污染编码套件(补全/生成/JS/Python/TS) Score % 43

六榜分别代表:人类偏好(LMArena 双榜)、厂商自评(CursorBench)、综合智能(AA)、职业真实任务(Vals)与抗污染静态评测(LiveBench)。方法论差异本身就是榜首分裂的根源——这一点在后文展开。

六榜快照总表

下表为 2026 年 10 月 3 日聚合镜像快照(镜像声明与各官方榜 1:1 对齐、不做二次加权;LMArena 双榜另有 10 月 1 日快照可比对,分数存在小幅波动)。各榜前五名如下:

榜单 榜首 第 2 第 3 第 4 第 5
LMArena Code(Elo) Opus 5.5(约 1815) GPT-6 Astra(约 1788) Sonnet 5.5(约 1786) GPT-6 Sol(约 1758) Fable 5.1(约 1749)
LMArena Agent(Agent Score) Fable 5.1(约 14.3) Opus 5.5(约 13.8) Sonnet 5.5(约 12.5) GPT-6 Astra(约 12.3) GPT-6 Sol(约 11.2)
CursorBench v4.0(通过率) Opus 5.5(57.8%) Fable 5.1(51.8%) Opus 5(46.6%) Grok 4.7(46.3%) GPT-5.6 Sol(41.7%)
Artificial Analysis(智能指数) Opus 5.5(57.6) Sonnet 5.5(56.0) Fable 5.1(53.4) GPT-6 Astra(52.7) Gemini 4 Argon(52.6)
Vals AI(准确率) Gemini 4 Argon(68.9%) Sonnet 5.5(67.0%) Opus 5.5(67.0%) Fable 5.1(65.8%) Opus 5(63.7%)
LiveBench(分数) Fable 5.1(83.4%) Opus 5.5(83.2%) Fable 5(83.0%) GPT-6 Astra(82.2%) Muse Spark 1.3(81.6%)
🧩 本篇的核心观察

六张榜单、三个榜首:Opus 5.5 拿下 LMArena Code、CursorBench、AA 三榜,Fable 5.1 拿下 LMArena Agent 与 LiveBench 两榜,Gemini 4 Argon 拿下 Vals AI 一榜。没有任何一款模型横扫六榜;同时,GPT-6 系两款(Astra/Sol)在全部六榜都未登顶,但在多数榜单稳居前五——「没有榜首」不等于「没有竞争力」。

榜首分裂的三条断层线

断层线一:人类偏好与执行通过率并不重合。LMArena 的两榜都是人类盲测投票,但 Code 榜(对话式编码)与 Agent 榜(真实智能体会话)的榜首就分裂了:Code 榜用户把票投给 Opus 5.5,Agent 榜用户更认可 Fable 5.1。到了执行式的 CursorBench(真实跑代码、判通过率),Opus 5.5 重新登顶。人类「读着舒服」的回答与「跑得通」的产物,在 2026 年 10 月仍是两种能力。

断层线二:通用智能与编码专精的相关性有限。AA 综合智能指数把 Opus 5.5 排在全体 98 个模型之首,但专测真实职业任务的 Vals AI 却把 Gemini 4 Argon 排在首位(68.9%),且 Argon 在 AA 仅列第 5。一款模型可以是「综合最聪明」的,同时在软件、金融、网络安全任务上输给另一款——智能指数与任务准确率之间隔着任务分布与评分设计。

断层线三:抗污染评测的保守倾向。LiveBench 以题目持续更新、抗训练数据污染为卖点,其榜首 Fable 5.1(83.4%)与第 5 名 Muse Spark 1.3(81.6%)仅差 1.8 个百分点,头部高度拥挤;而偏好型榜单的分差要大得多。静态抗污染套件的区分度正在下降,这与本站此前「基准大换代」一篇的观察一致:老牌基准普遍进入饱和区。

跨榜异动:谁在榜单间「精神分裂」

横向比对真正的信息量在位次差。镜像快照的跨榜排名列里,几款模型的表现值得点名:

模型 跨榜位次表现(快照) 解读
Gemini 4 Argon Vals AI 榜首;LiveBench 编码第 1 位区间;AA 第 5;LMArena Code 第 8 区间 任务型与抗污染评测的宠儿,偏好型榜单遇冷——提示其输出风格可能不如输出质量讨喜
Grok 4.7 CursorBench 第 4(46.3%);LMArena Code 第 14 区间(Elo 约 1638) 执行通过率不差、人类偏好一般;参考本站此前横评,其在法务/财务等四类任务榜亦有登顶记录
Muse Spark 1.3 LiveBench 第 5(81.6%);LMArena Code 第 16 区间;Vals 第 9 区间 抗污染编码扎实,但综合位次平平,且以约 0.2 美元级定价出场,性价比画像明显
Sonnet 5.5 Vals 并列第 2(67.0%);AA 第 2;LMArena Agent 第 3;LMArena Code 第 3 区间 六榜无榜首但全部前五区间的「全能二当家」,是榜单分歧中位次最稳的一款

另一个结构性观察:六榜前五合计三十个席位,全部由闭源旗舰占据,开源权重模型在这组快照中没有进入任何一张榜的前五——尽管在执行式智能体评测(Toolathlon 等)中开源权重模型曾逼近头部。模型层编码榜单与智能体执行层榜单的头部构成并不同步,这再次印证:比编码智能体,只看模型层榜单是不够的。

口径警示:四把必须挂起的尺子

目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

选型建议:六榜怎么用

建议一:先选断层线,再选榜。如果采购场景以「人要审阅、体验要顺」为主(内部助手、结对编程),偏好型榜案权重可以高一些;如果以「机器跑批、结果验收」为主(CI 修复、批量迁移),执行通过率与职业任务类榜单(CursorBench、Vals)更具参考性;如果担心供应商刷榜或数据污染,LiveBench 这类抗污染套件作辅助。

建议二:看「稳」不看「尖」。本快照中位次最稳的是 Sonnet 5.5(六榜全部前五区间)与 Opus 5.5(三榜榜首、其余榜前四以内),而单榜登顶的 Argon 在另三榜跌出前五。对多数团队而言,跨榜方差小的模型意味着更少的意外——「六榜都前五」往往比「一榜榜首」更接近真实可用性。

建议三:把价格读进排名里。本篇未展开定价维度,但同场快照中,Muse Spark 1.3 以两位数分之差跻身 LiveBench 前五、GLM 与 DeepSeek 系在聚合镜像的性价比分层中处于 Ultra Value 档。榜首分裂的另一面是:头部 0.6 分之差对应的价差可能是数倍,性价比最优解几乎从不出现在榜首。结合本站此前多篇「成本 × 分数」横评阅读,结论会更完整。

六榜快照是一种「低分辨率但高保真」的观察方式:它无法告诉你谁更好用,但能可靠地告诉你——任何单一榜单的榜首,都不足以作为选型结论。

核心发现

参考来源

  1. AICoder — AI Coding Models Leaderboard(2026-10-03 快照,声明 1:1 镜像 LMArena/CursorBench/AA/Vals/LiveBench 等 7 家官方榜、不做二次加权)
  2. LMArena 官方排行榜 — Code(Coding Elo,52 模型)与 Agent(Agent Score,35 模型)双榜(lmarena.ai)
  3. CursorBench 官方页 — v4.0 智能体编码基准通过率榜(12 模型,厂商自建)
  4. Artificial Analysis — Intelligence Index 综合智能指数(98 模型)与 Vals AI — 软件及金融/网安任务准确率榜(30 模型)
  5. LiveBench 官方榜 — 抗污染编码套件分数(43 模型)
  6. 本站往期评测交叉 — R-BENCH-11 LiveBench 成本效率横评、R-BENCH-01 编码智能体能力横评(CursorBench 自评偏倚注记)