能力评测 2026-10-11 20 分钟阅读 进阶

2026 年 10 月智能体榜单快照:五张榜单怎么读,才不被分数骗

Verified 退役、pass^k 鸿沟、harness 口径分裂 — 一份带方法论防坑说明的季度榜单盘点

摘要

智能体榜单在 2026 年经历了集中换代:SWE-bench Verified 被头部厂商停报、Terminal-Bench 一年迭代到 4.0、OSWorld 2.0 重置了计算机操控赛道。本文以 10 月上旬各官方榜单的实时数据为截面,盘点五张核心榜单的头部成绩与人类基线,并拆解三个最容易让人被分数骗的方法论陷阱:一次通过与全通过之间的鸿沟、同一模型在不同 harness 下的分差、以及跨榜单比较的系统性风险。文末给出一套三步读榜法。

快照:五张榜单 10 月头部成绩

以下数据来自各官方榜单页面(读取于 2026 年 10 月 9 日至 11 日)。每张榜单的指标定义各不相同,行与行之间绝对不可直接比较——这本身就是本文要讲的核心问题之一。

榜单 考察内容 头部成绩(截至 10 月上旬) 人类基线 状态
SWE-bench Pro(公开集) 修复真实仓库缺陷 Muse Spark 1.1:61.50%(±3.10,新上榜) 未给出 活跃
Terminal-Bench 4.0 终端环境高难任务 Opus 5.5(max):64.8%(±3.1,9 月 22 日提交) 未给出 活跃
OSWorld 2.0 真实桌面长程工作流 Claude Opus 5(max):31.4% 人类单任务中位约 1.6 小时 活跃
tau-bench(banking) 约 700 份文档上的客服对话 Qwen 3.8 Max:55.2%(pass^1,8 月 4 日) 未给出 活跃
BFCL V4 工具调用与参数 Claude Opus 4.5(FC 模式):77.47% 未给出 榜单 4 月后未再更新

两个补充坐标值得记录:GAIA 榜单上 Ops-Agentic-Search-2.0 已达 93.69%,超过 2023 年论文测得的 92% 人类基线——这是少数「越过人类线」的基准,也意味着它对头部模型的区分度正在失效;WebArena 上 DeepSeek V3.2 的 74.3% 与 78.24% 的人类基线已经贴近。当一张榜单的头部开始逼近人类基线,它测量的就不再是「差距」而是「饱和」。

一张分数的正确打开方式

任何一个分数都是在「一个模型 × 一个 agent 脚手架 × 一个基准版本 × 一个日期」下的测量值。四个变量里改任何一个,数字就会移动。把两个分数放在一起比较之前,先确认这四件事是否一致。

Verified 退役之后:引用指南

2026 年 2 月 23 日,OpenAI 停止报告 SWE-bench Verified,理由是该基准「污染日益严重」。此后行业完成了事实上的接棒:Scale AI 构建的 SWE-bench Pro 成为引用的替代品——1,865 个任务来自 41 个专业仓库,其中公开集 731 个实例来自 GPL 等强 Copyleft 许可仓库(用法律手段阻止训练数据污染),另有 276 个私有实例来自 18 个专有代码库;参考修复平均横跨 4.1 个文件、107.4 行代码;评分规则严格,修复必须让所有 fail-to-pass 测试通过且不破坏任何 pass-to-pass 测试。

与此同时,SWE-bench Verified 本身也走到了功能饱和:评测机构 Vals AI 报告,其测试的 86 个模型中已有 7 个跑出 95% 以上,该机构已停止运行这项基准。给选型者的直接建议是:2026 年下半年之后,任何仍在引用 SWE-bench Verified 作为核心卖点的厂商材料,都应要求其补充 SWE-bench Pro 或 Terminal-Bench 4.0 的成绩——要么是不了解基准换代,要么是旧分数更有利。

陷阱一:pass@1 与 pass^k 的鸿沟

tau-bench 系列基准提供了一个教科书级的案例:同一个零售场景条目,允许重试一次(pass@1)的成绩是 84.4%,而要求连续四轮全部通过(pass^4)时掉到 59.6%——落差接近 25 个百分点。两种指标都是「真的」,但描述的是两种完全不同的能力:

指标 含义 零售场景同一条目成绩 对应现实场景
pass@1 单次运行通过即可 84.4% 允许人工复核兜底的辅助场景
pass^4 连续四轮全部通过 59.6% 无人值守的自动化流程

对选型的含义非常直接:如果你的智能体跑在「每次决策都有人盯着」的辅助模式下,pass@1 类数字有参考价值;如果要交付的是无人值守的长程自动化,必须找 pass^k 口径的成绩,或者自己搭建重试一致性测试。厂商材料中最常见的操作,就是只给 pass@1 而不给 pass^k——不一定是故意误导,但读者必须主动追问。

陷阱二:同一模型,不同 harness,不同分数

Terminal-Bench 4.0 是 9 月发布潮各家必引的基准,但它恰好演示了 harness 与 effort(推理力度)口径的分裂。整理两个不同来源的数据:

模型 Snorkel 榜单读取值 厂商自报表汇总值(morphllm 汇编) 差异说明
Claude Sonnet 5.5 61.8% 70.6% effort 配置与脚手架不同
Claude Opus 5.5 64.8% 66.4% 差距较小但在误差范围边缘
GPT-6 Astra 58.2% 57.9% 基本一致
Claude Haiku 5.5 — 39.2% —
DeepSeek V4.1 Flash(开放权重) — 31.2% 厂商以 max effort 自报
Gemini 3.8 Flash — 19.1% 见下方版本提示

Sonnet 5.5 的近 9 分差距是最刺眼的样本:同一个模型,在不同脚手架与推理力度配置下成绩可以差出一整个名次区间。另一个必须检查的变量是基准版本:Google 报告 Gemini 3.8 Flash 在 Terminal-Bench 2.1 上为 89.4%,而在 4.0 上仅 19.1%——同一个模型,版本号不同,分差高达 70 分。Anthropic 自己给出的标准误差约 ±2.6 分,意味着两分以内的差距本质上是噪声。综合三条经验:引分数必须连版本号、脚手架与 effort 一起引;两分以内的差距不做结论;厂商自报与统一脚手架榜单要分开归档。

陷阱三:跨榜不可比与榜单滞后

跨榜单比较的诱惑永远存在,因为它能拼出「谁全面领先」的故事,但系统性风险至少有三个。

其一,榜单文案滞后于数据。SWE-bench Pro 页面的介绍文字至今仍写着「头部模型在公开集约 23%」,而其自身表格的头部已是 61.50%——官方页面自己都没跟上自己的数据。任何依赖单一来源的二手汇编都可能继承这类滞后。

其二,重要玩家可能缺席。GPT-6 与 Claude Opus 5 家族在 Terminal-Bench 4.0 等榜单上活跃,但在 SWE-bench Pro 官方榜上尚未出现提交;一份 10 月的「编码智能体全景排名」如果只引 Pro 榜,就会系统性漏掉这两家。缺席原因(未提交、策略性不参与、等待私有集评测)各不相同,但结果都是榜单不完整。

其三,头部模型的分数与价格要一起看。GPT-6.1 Sol(max)在 Terminal-Bench 4.0 上并列头部集团,标价约 0.6 千美元档,而榜单头部的报价约 4.7 千美元档——性能接近时,每分成本的差异就是采购决策的分水岭。只引分数不引价格的价格敏感型选型,等于没做评测。

增量观察

清华团队 10 月上旬开源的 VeriLoop E2 自报 SWE-bench Pro 76.2%,高于官方公开榜头部约 14.7 分,但因其使用自有脚手架且尚未提交 Scale 统一脚手架榜单,本文未将其计入快照。这类「有证据数据集但未上榜」的自报分数,建议单独归档跟踪,待第三方复核后再合并比较。

三步读榜法:给选型者的操作建议

把前文的陷阱收敛成一套可执行的动作。步骤一,对齐口径:确认基准版本、脚手架、effort、指标定义(pass@1 还是 pass^k)四要素,缺任何一个的分数降级为「参考信息」。步骤二,交叉归档:把统一脚手架官方榜与厂商自报分开放,自报分数标注「待复核」,直到出现独立复现或官方榜提交。步骤三,补上自己的测试:榜单测的是通用分布,你的业务是特殊分布——用自有任务集做一个 20 到 50 题的迷你评测,哪怕粗糙,对选型决策的边际价值也超过任何公开榜单的名次差。

榜单的价值从来不是告诉你「谁领先」,而是告诉你「在什么口径下、谁在什么任务形态上、领先谁多少」。口径丢了,名次就是空话。

核心发现

参考来源

  1. Gravity — AI Agent Benchmarks 2026: 5 That Matter, With October Scores(官方榜单数据 10 月 9 日读取)
  2. Snorkel AI Leaderboard — SWE-bench CLI / Terminal-Bench 4.0 等榜单页(2026.10)
  3. Scale AI — SWE-bench Pro(SEAL)公开榜单与任务构成说明
  4. Morph — Best AI Model for Coding 2026:15 模型基准与每分成本汇编(厂商自报表口径)
  5. Vals AI — SWE-bench Verified 停跑说明(86 模型中 7 款超 95%)