榜单体系与口径声明
Snorkel AI(源自斯坦福 AI 实验室的数据与评测公司)维护着一个公开榜单族,覆盖软件工程、知识工作与企业环境三大类,其中「Digital Work Index」是对八个高难度基准的经济加权综合。它同时也是 Open Benchmarks Grants 计划的组织方——向第三方基准提供资金与基础设施,Agents' Last Exam 即出于该计划。本文数据取自 2026 年 10 月 2 日的公开榜单快照,逐项可溯源。
口径先行声明三点:其一,Snorkel 榜单的分数多为 pass@1 或复合分,与厂商常用的「最优配置自报分」不可直接互换;其二,榜单同时收录模型分数与「模型 + 智能体工具」组合分数,阅读时必须分列;其三,各分项任务的通过率普遍远低于厂商惯用口径下的分数,这反映的是任务难度与评分严格度的差异,而非数据矛盾。
Digital Work Index:0.6 分内的饱和
Digital Work Index 是八项高难度基准(软件工程、逻辑推理、写作、专业环境)的经济加权综合。10 月 2 日快照下,前三名挤在 0.6 分之内:
| 排名 | 模型 | Digital Work Index |
|---|---|---|
| 1 | Claude Fable 5.1 | 23.62 |
| 2 | Claude Opus 5.5 | 23.61 |
| 3 | GPT-6 Astra | 23.03 |
| 4 | Claude Opus 5 | 21.75 |
| 5 | Grok 4.6 | 20.52 |
| 6 | Grok 4.7 | 19.30 |
| 7 | Gemini Flash 3.8 | 16.92 |
| 8 | Kimi K3 | 16.76 |
| 9 | GLM 5.3 | 16.45 |
| 10 | Muse Spark 1.3 | 16.29 |
| 11 | Qwen 3.8 Max | 11.81 |
| 12 | DeepSeek V4 Pro | 11.07 |
| 13 | Nemotron 3 Ultra 550B | 6.95 |
两件事值得注意。其一,榜首与榜眼只差 0.01 分——在综合口径层面,「谁更强」的问题已经失去统计意义;Fable 5.1 与 Opus 5.5 是同一实验室的相邻代际产品,这个结果更像同门内部的结构性趋同。其二,开源权重阵营与闭源阵营之间存在约 5 至 16 分的断层:Kimi K3、GLM 5.3、Muse Spark 1.3 集中在 16 分档,DeepSeek V4 Pro 11.07、Nemotron 3 Ultra 6.95 处在更深的低位。综合口径下「开源追平前沿」的说法,在这张表上得不到支持。
但综合指数的价值恰恰有限——它把下面这些分项的结构性差异全部抹平了。
Agentic Coding 2.0:自主工程的全循环
Agentic Coding 2.0 是 Snorkel 原初 Agentic Coding 基准的换代,取自 Terminal-Bench+ 数据集的前沿子集,把评测从「难题解答」扩展到「自主工程」:软件工程、调试、系统、安全、数据处理、机器学习、科学计算、游戏、构建与依赖管理九类任务,每题在隔离且断网的环境中运行,要求智能体使用工具、管理中间状态、验证工作、从错误中恢复;每题带参考解、确定性测试,以及同时评价最终结果与行动轨迹的评分细则(rubrics)。
| 模型 | Agentic Coding 2.0(pass@1) | 位次 | 参照:Terminal-Bench 4.0(分辨率率) |
|---|---|---|---|
| GPT-6 Astra | 47.6% | 1 / 13 | 58.2% |
| Claude Opus 5.5 | 40.4% | 2 / 13 | 66.4%(厂商口径) |
| Gemini Flash 3.8 | 32.6% | 6 / 13 | — |
| Grok 4.7 | 31.9% | 7 / 13 | — |
同样的模型群,在 Terminal-Bench 4.0 上 Opus 5.5 以 66.4% 位居榜首(厂商自报口径),而在 Agentic Coding 2.0 上以 40.4% 居于 Astra 之后。两个基准都考终端里的自主编码,差距来自任务构成:前者任务相对「纯」,后者把安全、依赖管理、状态恢复这些工程脏活一并计入,还用轨迹评分约束「怎么做成」。Astra 与 Opus 5.5 的顺序翻转,说明模型在「把题做对」与「把工程做完整」上是两种可分离的能力。
Agentic Coding 2.0 用 air-gapped 环境 + 轨迹评分细则 双重设计压缩了「碰运气通过」与「绕过验证」的空间。它是目前把「自主工程」定义得最完整的公开基准之一,也是三强综合分饱和背景下区分度最高的分项。
排名翻转:Grok 4.6 与 GPT-6 Astra 的双面画像
分项榜单上出现了剧烈的跨域翻转,两个案例足以说明:
Grok 4.6 的双面画像。在专业工作流类基准上它几乎横扫:SnorkelLegal 40.7%、SnorkelFinance 2.0 25.1%、WorkplaceAgents 17.1%、SnorkelRevOps 15.8%,四个榜单全部位居榜首;可一到 Agentic Coding 2.0,它只拿到中游位次。xAI 自家的 4.7 代际在 Senior SWE-Bench(27.4%)与 SnorkelFinance(20.2%)上反而被 4.6 反超——代际更新并不保证全谱系进步。
GPT-6 Astra 的另一面。同一个 Astra,Agentic Coding 2.0 位列榜首(47.6%)、Agents' Last Exam 34.2% 位居次席,但 SnorkelLegal 只有 20.9%、在 13 个模型中垫底,SnorkelFinance 11.6% 排在第九。以「法律检索与程序遵循」为核心的场景里,Astra 是明显的短板项——这与多家第三方评测中 Astra 幻觉率偏高、引用准确性受质疑的观察相互印证。
| 基准 | 榜首 | 分数 | 同一基准上的反差样本 |
|---|---|---|---|
| SnorkelLegal | Grok 4.6 | 40.7% | GPT-6 Astra 20.9%(13 款中垫底) |
| SnorkelFinance 2.0 | Grok 4.6 | 25.1% | GPT-6 Astra 11.6%(第九) |
| WorkplaceAgents | Grok 4.6 | 17.1% | Claude Fable 5.1 15.8%(第二) |
| Agentic Coding 2.0 | GPT-6 Astra | 47.6% | Grok 4.6 处中游、Grok 4.7 31.9%(第七) |
结论直接而务实:2026 年秋已经不存在「全谱系领先」的模型。任何「某模型登顶」的新闻标题,都必须追问是哪张榜、哪个分项、什么口径。
更难的刻度:CLI 与专业工作台的低分带
Snorkel 收录的几个「刻度更硬」的榜单,把前沿模型的通过率压到了与厂商口径相差一个量级的位置:
| 基准 | 衡量对象 | 前三名与分数(pass@1) |
|---|---|---|
| SWE-bench CLI | 开源仓库中经验证的多文件改动 | Opus 5.5 16.6% / Fable 5.1 14.5% / Opus 5 14.0% |
| WorkplaceAgents | 有经济价值的职场交付物 | Grok 4.6 17.1% / Fable 5.1 15.8% / Grok 4.7 15.2% |
| SnorkelFinance 2.0 | 需要取证、分析与合规的财务工作流 | Grok 4.6 25.1% / GLM 5.3 21.2% / Grok 4.7 20.2% |
| SnorkelUnderwrite 2.0 | 基于不完整分布式证据的可审计核保 | Grok 4.7 30.5% / GLM 5.3 30.4% / Nemotron 3 Ultra 30.0% |
SWE-bench CLI 的 16.6% 与 DeepSWE 类口径的 74% 至 78% 并不矛盾:后者多为「给定明确改动的定向修复」且常取最优配置;前者要求在真实仓库中完成经多文件验证的变更,且以 pass@1 计。同理,SnorkelUnderwrite 上三强挤在 0.5 分内、而开源权重的 Nemotron 3 Ultra 并列前三——在「证据不完整、要求可审计」这类企业真实约束下,模型间的差距被压缩,工程化配置(证据管线、审计日志)的作用被放大。这正是企业与媒体评测口径分歧的微观样本。
LibraryDesignBench:给别的智能体用的库
Snorkel 于 10 月 1 日重点推介的 LibraryDesignBench 是一个新颖的切面:不评「智能体能否完成任务」,而评「智能体设计的库能否帮其他智能体把活干好」。该基准由 Snorkel 研究员 Gabriel Orlanski(威斯康星大学麦迪逊分校博士生)在 2026 年 9 月 29 日提交的论文中提出,包含 15 个库设计任务与 242 道下游编程题,覆盖 Rust、Python、TypeScript、Haskell 四种语言。
| 配置 | 综合分(0-100) | 说明 |
|---|---|---|
| 智能体设计库(榜首运行) | 48.9(下游通过率 86.6%) | 评分同时奖励正确性与下游代码简洁度 |
| 人类编写生产库参考 | 46.6 | 如 Rust clap、Python pandas 类比的成熟接口 |
| 无库参考 | 34.4 | 下游智能体从零实现 |
细节比榜首数字更有信息量:智能体设计者在 15 个任务中的 11 个复现了人类库的抽象,但下游智能体经常「不用」拿到的库,重新实现已有能力——论文把多余代码主要归因于僵化难用的接口,而非功能缺失。更刺眼的对照:某个上榜运行低于「无库参考」,而在 Haskell 上,智能体写的库在 70% 的「设计者-任务」配对中还不如没有库。一个糟糕的抽象会增加而不是减少下游工作量。论文还测试了两种改进(给设计者更明确的面向智能体的指南、允许用子智能体测试设计),均能提升下游得分——这指向可落地的工程实践。需要说明:该基准的 15 个任务远不能代表所有库类型,评分也不涉及库的安全性、性能与可维护性。
三条阅读规则与选型含义
把上述数据放在一起,我们给出评测碎片化时代的三条阅读规则:
- 先问口径,再看分数。综合指数(0.01 分的榜首差距)、定向修复基准(74% 档)与全循环工程基准(16% 至 47% 档)测的是三种不同的东西。任何跨榜比较分数的行为,在方法论上已经出错。
- 按业务域找分项,别按总分选模型。法务与财务工作流选型应看 SnorkelLegal / SnorkelFinance 而非 Digital Work Index;自主编码选型应看 Agentic Coding 2.0 与 Terminal-Bench 4.0 的组合。Grok 4.6 与 Astra 的翻转画像说明,错误的对标会带来系统性误判。
- 警惕评测方与被评方的利益关联。Snorkel 同时是基准组织方与数据服务厂商,Open Benchmarks Grants 计划资助的任务与自身产品线存在叙事协同;厂商自报分则天然偏向自家最优配置。分数本身可复核,但「谁在定义什么算好」值得每次追问。
对企业选型的直接含义:把 2026 年秋的榜单当作「能力地图」而非「排名榜」——先定位自己的任务域,再读对应分项,最后用自己的黄金数据集做闭环验证。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。