为什么是这六张榜:方法论谱系
本文选定的六张榜覆盖了当前模型层评测的四种主流方法论,且全部公开可查。需要先划清一个边界:本篇比的是模型层的六张榜单,而非 Harness/智能体产品层的执行式评测(如 DeepSWE、Terminal-Bench 那类带脚手架的对比,本站此前已有多篇专文覆盖)。模型层榜单回答的是「底座模型编码能力如何」,与最终智能体产品的表现之间还隔着 Harness 这一变量。
| 榜单 | 方法论 | 指标 | 收录模型数 |
|---|---|---|---|
| LMArena Code | 人类盲测对战(编码场景) | Coding Elo | 52 |
| LMArena Agent | 人类盲测对战(真实智能体编码会话) | Agent Score | 35 |
| CursorBench v4.0 | 厂商自建智能体编码基准(通过率) | Pass rate % | 12 |
| Artificial Analysis | 独立综合智能指数 | Intelligence Index | 98 |
| Vals AI | 独立评测:软件/金融/网络安全真实任务 | Accuracy % | 30 |
| LiveBench | 抗污染编码套件(补全/生成/JS/Python/TS) | Score % | 43 |
六榜分别代表:人类偏好(LMArena 双榜)、厂商自评(CursorBench)、综合智能(AA)、职业真实任务(Vals)与抗污染静态评测(LiveBench)。方法论差异本身就是榜首分裂的根源——这一点在后文展开。
六榜快照总表
下表为 2026 年 10 月 3 日聚合镜像快照(镜像声明与各官方榜 1:1 对齐、不做二次加权;LMArena 双榜另有 10 月 1 日快照可比对,分数存在小幅波动)。各榜前五名如下:
| 榜单 | 榜首 | 第 2 | 第 3 | 第 4 | 第 5 |
|---|---|---|---|---|---|
| LMArena Code(Elo) | Opus 5.5(约 1815) | GPT-6 Astra(约 1788) | Sonnet 5.5(约 1786) | GPT-6 Sol(约 1758) | Fable 5.1(约 1749) |
| LMArena Agent(Agent Score) | Fable 5.1(约 14.3) | Opus 5.5(约 13.8) | Sonnet 5.5(约 12.5) | GPT-6 Astra(约 12.3) | GPT-6 Sol(约 11.2) |
| CursorBench v4.0(通过率) | Opus 5.5(57.8%) | Fable 5.1(51.8%) | Opus 5(46.6%) | Grok 4.7(46.3%) | GPT-5.6 Sol(41.7%) |
| Artificial Analysis(智能指数) | Opus 5.5(57.6) | Sonnet 5.5(56.0) | Fable 5.1(53.4) | GPT-6 Astra(52.7) | Gemini 4 Argon(52.6) |
| Vals AI(准确率) | Gemini 4 Argon(68.9%) | Sonnet 5.5(67.0%) | Opus 5.5(67.0%) | Fable 5.1(65.8%) | Opus 5(63.7%) |
| LiveBench(分数) | Fable 5.1(83.4%) | Opus 5.5(83.2%) | Fable 5(83.0%) | GPT-6 Astra(82.2%) | Muse Spark 1.3(81.6%) |
六张榜单、三个榜首:Opus 5.5 拿下 LMArena Code、CursorBench、AA 三榜,Fable 5.1 拿下 LMArena Agent 与 LiveBench 两榜,Gemini 4 Argon 拿下 Vals AI 一榜。没有任何一款模型横扫六榜;同时,GPT-6 系两款(Astra/Sol)在全部六榜都未登顶,但在多数榜单稳居前五——「没有榜首」不等于「没有竞争力」。
榜首分裂的三条断层线
断层线一:人类偏好与执行通过率并不重合。LMArena 的两榜都是人类盲测投票,但 Code 榜(对话式编码)与 Agent 榜(真实智能体会话)的榜首就分裂了:Code 榜用户把票投给 Opus 5.5,Agent 榜用户更认可 Fable 5.1。到了执行式的 CursorBench(真实跑代码、判通过率),Opus 5.5 重新登顶。人类「读着舒服」的回答与「跑得通」的产物,在 2026 年 10 月仍是两种能力。
断层线二:通用智能与编码专精的相关性有限。AA 综合智能指数把 Opus 5.5 排在全体 98 个模型之首,但专测真实职业任务的 Vals AI 却把 Gemini 4 Argon 排在首位(68.9%),且 Argon 在 AA 仅列第 5。一款模型可以是「综合最聪明」的,同时在软件、金融、网络安全任务上输给另一款——智能指数与任务准确率之间隔着任务分布与评分设计。
断层线三:抗污染评测的保守倾向。LiveBench 以题目持续更新、抗训练数据污染为卖点,其榜首 Fable 5.1(83.4%)与第 5 名 Muse Spark 1.3(81.6%)仅差 1.8 个百分点,头部高度拥挤;而偏好型榜单的分差要大得多。静态抗污染套件的区分度正在下降,这与本站此前「基准大换代」一篇的观察一致:老牌基准普遍进入饱和区。
跨榜异动:谁在榜单间「精神分裂」
横向比对真正的信息量在位次差。镜像快照的跨榜排名列里,几款模型的表现值得点名:
| 模型 | 跨榜位次表现(快照) | 解读 |
|---|---|---|
| Gemini 4 Argon | Vals AI 榜首;LiveBench 编码第 1 位区间;AA 第 5;LMArena Code 第 8 区间 | 任务型与抗污染评测的宠儿,偏好型榜单遇冷——提示其输出风格可能不如输出质量讨喜 |
| Grok 4.7 | CursorBench 第 4(46.3%);LMArena Code 第 14 区间(Elo 约 1638) | 执行通过率不差、人类偏好一般;参考本站此前横评,其在法务/财务等四类任务榜亦有登顶记录 |
| Muse Spark 1.3 | LiveBench 第 5(81.6%);LMArena Code 第 16 区间;Vals 第 9 区间 | 抗污染编码扎实,但综合位次平平,且以约 0.2 美元级定价出场,性价比画像明显 |
| Sonnet 5.5 | Vals 并列第 2(67.0%);AA 第 2;LMArena Agent 第 3;LMArena Code 第 3 区间 | 六榜无榜首但全部前五区间的「全能二当家」,是榜单分歧中位次最稳的一款 |
另一个结构性观察:六榜前五合计三十个席位,全部由闭源旗舰占据,开源权重模型在这组快照中没有进入任何一张榜的前五——尽管在执行式智能体评测(Toolathlon 等)中开源权重模型曾逼近头部。模型层编码榜单与智能体执行层榜单的头部构成并不同步,这再次印证:比编码智能体,只看模型层榜单是不够的。
口径警示:四把必须挂起的尺子
- Elo 类榜单的波动性:LMArena 双榜随真实对局滚动更新,本镜像 10 月 1 日与 10 月 3 日两次快照间,部分模型分数已出现小幅变动(如 Opus 5.5 的 Code Elo 从约 1818 变至约 1815,Sonnet 5.5 位次与分数亦有变化)。任何精确到小数点的排名都只代表抓取时点,请以官方榜实时数据为准。
- 厂商自建基准的自评偏倚:CursorBench 是 Cursor 的自建基准,本站首篇横评即已注明其存在自评偏倚、仅作参考对照。有趣的是,Cursor 的母体生态与 Anthropic 模型深度绑定,榜首恰为 Opus 5.5——偏倚方向未必指向自家产品,但方法论上仍是单点观察。
- 聚合镜像的转述环节:本篇数据取自声明「1:1 镜像、不加权」的聚合站,而非逐榜直接抓取官方页面;镜像本身可能存在缓存滞后或字段错位。分数用于观察结构性分歧绰绰有余,用于精确比较相邻两名则不够。
- 模型层 ≠ 产品层:六榜都是模型评测,不含 Harness。同一底座在 Claude Code、Codex CLI、Gemini CLI 等不同 Harness 下的实际表现差异,本站多篇评测已证明可达数十分——选型时两层数据都要看。
目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
选型建议:六榜怎么用
建议一:先选断层线,再选榜。如果采购场景以「人要审阅、体验要顺」为主(内部助手、结对编程),偏好型榜案权重可以高一些;如果以「机器跑批、结果验收」为主(CI 修复、批量迁移),执行通过率与职业任务类榜单(CursorBench、Vals)更具参考性;如果担心供应商刷榜或数据污染,LiveBench 这类抗污染套件作辅助。
建议二:看「稳」不看「尖」。本快照中位次最稳的是 Sonnet 5.5(六榜全部前五区间)与 Opus 5.5(三榜榜首、其余榜前四以内),而单榜登顶的 Argon 在另三榜跌出前五。对多数团队而言,跨榜方差小的模型意味着更少的意外——「六榜都前五」往往比「一榜榜首」更接近真实可用性。
建议三:把价格读进排名里。本篇未展开定价维度,但同场快照中,Muse Spark 1.3 以两位数分之差跻身 LiveBench 前五、GLM 与 DeepSeek 系在聚合镜像的性价比分层中处于 Ultra Value 档。榜首分裂的另一面是:头部 0.6 分之差对应的价差可能是数倍,性价比最优解几乎从不出现在榜首。结合本站此前多篇「成本 × 分数」横评阅读,结论会更完整。
六榜快照是一种「低分辨率但高保真」的观察方式:它无法告诉你谁更好用,但能可靠地告诉你——任何单一榜单的榜首,都不足以作为选型结论。