快照:五张榜单 10 月头部成绩
以下数据来自各官方榜单页面(读取于 2026 年 10 月 9 日至 11 日)。每张榜单的指标定义各不相同,行与行之间绝对不可直接比较——这本身就是本文要讲的核心问题之一。
| 榜单 | 考察内容 | 头部成绩(截至 10 月上旬) | 人类基线 | 状态 |
|---|---|---|---|---|
| SWE-bench Pro(公开集) | 修复真实仓库缺陷 | Muse Spark 1.1:61.50%(±3.10,新上榜) | 未给出 | 活跃 |
| Terminal-Bench 4.0 | 终端环境高难任务 | Opus 5.5(max):64.8%(±3.1,9 月 22 日提交) | 未给出 | 活跃 |
| OSWorld 2.0 | 真实桌面长程工作流 | Claude Opus 5(max):31.4% | 人类单任务中位约 1.6 小时 | 活跃 |
| tau-bench(banking) | 约 700 份文档上的客服对话 | Qwen 3.8 Max:55.2%(pass^1,8 月 4 日) | 未给出 | 活跃 |
| BFCL V4 | 工具调用与参数 | Claude Opus 4.5(FC 模式):77.47% | 未给出 | 榜单 4 月后未再更新 |
两个补充坐标值得记录:GAIA 榜单上 Ops-Agentic-Search-2.0 已达 93.69%,超过 2023 年论文测得的 92% 人类基线——这是少数「越过人类线」的基准,也意味着它对头部模型的区分度正在失效;WebArena 上 DeepSeek V3.2 的 74.3% 与 78.24% 的人类基线已经贴近。当一张榜单的头部开始逼近人类基线,它测量的就不再是「差距」而是「饱和」。
任何一个分数都是在「一个模型 × 一个 agent 脚手架 × 一个基准版本 × 一个日期」下的测量值。四个变量里改任何一个,数字就会移动。把两个分数放在一起比较之前,先确认这四件事是否一致。
Verified 退役之后:引用指南
2026 年 2 月 23 日,OpenAI 停止报告 SWE-bench Verified,理由是该基准「污染日益严重」。此后行业完成了事实上的接棒:Scale AI 构建的 SWE-bench Pro 成为引用的替代品——1,865 个任务来自 41 个专业仓库,其中公开集 731 个实例来自 GPL 等强 Copyleft 许可仓库(用法律手段阻止训练数据污染),另有 276 个私有实例来自 18 个专有代码库;参考修复平均横跨 4.1 个文件、107.4 行代码;评分规则严格,修复必须让所有 fail-to-pass 测试通过且不破坏任何 pass-to-pass 测试。
与此同时,SWE-bench Verified 本身也走到了功能饱和:评测机构 Vals AI 报告,其测试的 86 个模型中已有 7 个跑出 95% 以上,该机构已停止运行这项基准。给选型者的直接建议是:2026 年下半年之后,任何仍在引用 SWE-bench Verified 作为核心卖点的厂商材料,都应要求其补充 SWE-bench Pro 或 Terminal-Bench 4.0 的成绩——要么是不了解基准换代,要么是旧分数更有利。
陷阱一:pass@1 与 pass^k 的鸿沟
tau-bench 系列基准提供了一个教科书级的案例:同一个零售场景条目,允许重试一次(pass@1)的成绩是 84.4%,而要求连续四轮全部通过(pass^4)时掉到 59.6%——落差接近 25 个百分点。两种指标都是「真的」,但描述的是两种完全不同的能力:
| 指标 | 含义 | 零售场景同一条目成绩 | 对应现实场景 |
|---|---|---|---|
| pass@1 | 单次运行通过即可 | 84.4% | 允许人工复核兜底的辅助场景 |
| pass^4 | 连续四轮全部通过 | 59.6% | 无人值守的自动化流程 |
对选型的含义非常直接:如果你的智能体跑在「每次决策都有人盯着」的辅助模式下,pass@1 类数字有参考价值;如果要交付的是无人值守的长程自动化,必须找 pass^k 口径的成绩,或者自己搭建重试一致性测试。厂商材料中最常见的操作,就是只给 pass@1 而不给 pass^k——不一定是故意误导,但读者必须主动追问。
陷阱二:同一模型,不同 harness,不同分数
Terminal-Bench 4.0 是 9 月发布潮各家必引的基准,但它恰好演示了 harness 与 effort(推理力度)口径的分裂。整理两个不同来源的数据:
| 模型 | Snorkel 榜单读取值 | 厂商自报表汇总值(morphllm 汇编) | 差异说明 |
|---|---|---|---|
| Claude Sonnet 5.5 | 61.8% | 70.6% | effort 配置与脚手架不同 |
| Claude Opus 5.5 | 64.8% | 66.4% | 差距较小但在误差范围边缘 |
| GPT-6 Astra | 58.2% | 57.9% | 基本一致 |
| Claude Haiku 5.5 | — | 39.2% | — |
| DeepSeek V4.1 Flash(开放权重) | — | 31.2% | 厂商以 max effort 自报 |
| Gemini 3.8 Flash | — | 19.1% | 见下方版本提示 |
Sonnet 5.5 的近 9 分差距是最刺眼的样本:同一个模型,在不同脚手架与推理力度配置下成绩可以差出一整个名次区间。另一个必须检查的变量是基准版本:Google 报告 Gemini 3.8 Flash 在 Terminal-Bench 2.1 上为 89.4%,而在 4.0 上仅 19.1%——同一个模型,版本号不同,分差高达 70 分。Anthropic 自己给出的标准误差约 ±2.6 分,意味着两分以内的差距本质上是噪声。综合三条经验:引分数必须连版本号、脚手架与 effort 一起引;两分以内的差距不做结论;厂商自报与统一脚手架榜单要分开归档。
陷阱三:跨榜不可比与榜单滞后
跨榜单比较的诱惑永远存在,因为它能拼出「谁全面领先」的故事,但系统性风险至少有三个。
其一,榜单文案滞后于数据。SWE-bench Pro 页面的介绍文字至今仍写着「头部模型在公开集约 23%」,而其自身表格的头部已是 61.50%——官方页面自己都没跟上自己的数据。任何依赖单一来源的二手汇编都可能继承这类滞后。
其二,重要玩家可能缺席。GPT-6 与 Claude Opus 5 家族在 Terminal-Bench 4.0 等榜单上活跃,但在 SWE-bench Pro 官方榜上尚未出现提交;一份 10 月的「编码智能体全景排名」如果只引 Pro 榜,就会系统性漏掉这两家。缺席原因(未提交、策略性不参与、等待私有集评测)各不相同,但结果都是榜单不完整。
其三,头部模型的分数与价格要一起看。GPT-6.1 Sol(max)在 Terminal-Bench 4.0 上并列头部集团,标价约 0.6 千美元档,而榜单头部的报价约 4.7 千美元档——性能接近时,每分成本的差异就是采购决策的分水岭。只引分数不引价格的价格敏感型选型,等于没做评测。
清华团队 10 月上旬开源的 VeriLoop E2 自报 SWE-bench Pro 76.2%,高于官方公开榜头部约 14.7 分,但因其使用自有脚手架且尚未提交 Scale 统一脚手架榜单,本文未将其计入快照。这类「有证据数据集但未上榜」的自报分数,建议单独归档跟踪,待第三方复核后再合并比较。
三步读榜法:给选型者的操作建议
把前文的陷阱收敛成一套可执行的动作。步骤一,对齐口径:确认基准版本、脚手架、effort、指标定义(pass@1 还是 pass^k)四要素,缺任何一个的分数降级为「参考信息」。步骤二,交叉归档:把统一脚手架官方榜与厂商自报分开放,自报分数标注「待复核」,直到出现独立复现或官方榜提交。步骤三,补上自己的测试:榜单测的是通用分布,你的业务是特殊分布——用自有任务集做一个 20 到 50 题的迷你评测,哪怕粗糙,对选型决策的边际价值也超过任何公开榜单的名次差。
榜单的价值从来不是告诉你「谁领先」,而是告诉你「在什么口径下、谁在什么任务形态上、领先谁多少」。口径丢了,名次就是空话。