能力评测 2026-10-02 25 分钟阅读 进阶

Snorkel 开放基准群横评:排名为何系统性翻转

Digital Work Index 0.6 分内的饱和三强、SWE-bench CLI 16.6% 的口径落差 — 榜单碎片化时代的三条阅读规则

摘要

2026 年秋季,Snorkel AI 的公开榜单已经成为观察前沿模型与编码智能体的关键窗口:Digital Work Index 上 Claude Fable 5.1、Claude Opus 5.5、GPT-6 Astra 三强挤在 0.6 分内,而同样是这三款模型,在 Agentic Coding 2.0、SWE-bench CLI、WorkplaceAgents 等分项上的排序互有反复,与厂商自报的 DeepSWE 类口径相差可达三倍以上。本文以榜单快照为底,逐表拆解量化数据,解释排名系统性翻转的三个来源——任务设计、评分口径与模型特长分布——并给出评测碎片化时代的三条阅读规则。

榜单体系与口径声明

Snorkel AI(源自斯坦福 AI 实验室的数据与评测公司)维护着一个公开榜单族,覆盖软件工程、知识工作与企业环境三大类,其中「Digital Work Index」是对八个高难度基准的经济加权综合。它同时也是 Open Benchmarks Grants 计划的组织方——向第三方基准提供资金与基础设施,Agents' Last Exam 即出于该计划。本文数据取自 2026 年 10 月 2 日的公开榜单快照,逐项可溯源。

口径先行声明三点:其一,Snorkel 榜单的分数多为 pass@1 或复合分,与厂商常用的「最优配置自报分」不可直接互换;其二,榜单同时收录模型分数与「模型 + 智能体工具」组合分数,阅读时必须分列;其三,各分项任务的通过率普遍远低于厂商惯用口径下的分数,这反映的是任务难度与评分严格度的差异,而非数据矛盾。

Digital Work Index:0.6 分内的饱和

Digital Work Index 是八项高难度基准(软件工程、逻辑推理、写作、专业环境)的经济加权综合。10 月 2 日快照下,前三名挤在 0.6 分之内:

排名 模型 Digital Work Index
1 Claude Fable 5.1 23.62
2 Claude Opus 5.5 23.61
3 GPT-6 Astra 23.03
4 Claude Opus 5 21.75
5 Grok 4.6 20.52
6 Grok 4.7 19.30
7 Gemini Flash 3.8 16.92
8 Kimi K3 16.76
9 GLM 5.3 16.45
10 Muse Spark 1.3 16.29
11 Qwen 3.8 Max 11.81
12 DeepSeek V4 Pro 11.07
13 Nemotron 3 Ultra 550B 6.95

两件事值得注意。其一,榜首与榜眼只差 0.01 分——在综合口径层面,「谁更强」的问题已经失去统计意义;Fable 5.1 与 Opus 5.5 是同一实验室的相邻代际产品,这个结果更像同门内部的结构性趋同。其二,开源权重阵营与闭源阵营之间存在约 5 至 16 分的断层:Kimi K3、GLM 5.3、Muse Spark 1.3 集中在 16 分档,DeepSeek V4 Pro 11.07、Nemotron 3 Ultra 6.95 处在更深的低位。综合口径下「开源追平前沿」的说法,在这张表上得不到支持。

但综合指数的价值恰恰有限——它把下面这些分项的结构性差异全部抹平了。

Agentic Coding 2.0:自主工程的全循环

Agentic Coding 2.0 是 Snorkel 原初 Agentic Coding 基准的换代,取自 Terminal-Bench+ 数据集的前沿子集,把评测从「难题解答」扩展到「自主工程」:软件工程、调试、系统、安全、数据处理、机器学习、科学计算、游戏、构建与依赖管理九类任务,每题在隔离且断网的环境中运行,要求智能体使用工具、管理中间状态、验证工作、从错误中恢复;每题带参考解、确定性测试,以及同时评价最终结果与行动轨迹的评分细则(rubrics)。

模型 Agentic Coding 2.0(pass@1) 位次 参照:Terminal-Bench 4.0(分辨率率)
GPT-6 Astra 47.6% 1 / 13 58.2%
Claude Opus 5.5 40.4% 2 / 13 66.4%(厂商口径)
Gemini Flash 3.8 32.6% 6 / 13 —
Grok 4.7 31.9% 7 / 13 —

同样的模型群,在 Terminal-Bench 4.0 上 Opus 5.5 以 66.4% 位居榜首(厂商自报口径),而在 Agentic Coding 2.0 上以 40.4% 居于 Astra 之后。两个基准都考终端里的自主编码,差距来自任务构成:前者任务相对「纯」,后者把安全、依赖管理、状态恢复这些工程脏活一并计入,还用轨迹评分约束「怎么做成」。Astra 与 Opus 5.5 的顺序翻转,说明模型在「把题做对」与「把工程做完整」上是两种可分离的能力。

📊 关键观察

Agentic Coding 2.0 用 air-gapped 环境 + 轨迹评分细则 双重设计压缩了「碰运气通过」与「绕过验证」的空间。它是目前把「自主工程」定义得最完整的公开基准之一,也是三强综合分饱和背景下区分度最高的分项。

排名翻转:Grok 4.6 与 GPT-6 Astra 的双面画像

分项榜单上出现了剧烈的跨域翻转,两个案例足以说明:

Grok 4.6 的双面画像。在专业工作流类基准上它几乎横扫:SnorkelLegal 40.7%、SnorkelFinance 2.0 25.1%、WorkplaceAgents 17.1%、SnorkelRevOps 15.8%,四个榜单全部位居榜首;可一到 Agentic Coding 2.0,它只拿到中游位次。xAI 自家的 4.7 代际在 Senior SWE-Bench(27.4%)与 SnorkelFinance(20.2%)上反而被 4.6 反超——代际更新并不保证全谱系进步。

GPT-6 Astra 的另一面。同一个 Astra,Agentic Coding 2.0 位列榜首(47.6%)、Agents' Last Exam 34.2% 位居次席,但 SnorkelLegal 只有 20.9%、在 13 个模型中垫底,SnorkelFinance 11.6% 排在第九。以「法律检索与程序遵循」为核心的场景里,Astra 是明显的短板项——这与多家第三方评测中 Astra 幻觉率偏高、引用准确性受质疑的观察相互印证。

基准 榜首 分数 同一基准上的反差样本
SnorkelLegal Grok 4.6 40.7% GPT-6 Astra 20.9%(13 款中垫底)
SnorkelFinance 2.0 Grok 4.6 25.1% GPT-6 Astra 11.6%(第九)
WorkplaceAgents Grok 4.6 17.1% Claude Fable 5.1 15.8%(第二)
Agentic Coding 2.0 GPT-6 Astra 47.6% Grok 4.6 处中游、Grok 4.7 31.9%(第七)

结论直接而务实:2026 年秋已经不存在「全谱系领先」的模型。任何「某模型登顶」的新闻标题,都必须追问是哪张榜、哪个分项、什么口径。

更难的刻度:CLI 与专业工作台的低分带

Snorkel 收录的几个「刻度更硬」的榜单,把前沿模型的通过率压到了与厂商口径相差一个量级的位置:

基准 衡量对象 前三名与分数(pass@1)
SWE-bench CLI 开源仓库中经验证的多文件改动 Opus 5.5 16.6% / Fable 5.1 14.5% / Opus 5 14.0%
WorkplaceAgents 有经济价值的职场交付物 Grok 4.6 17.1% / Fable 5.1 15.8% / Grok 4.7 15.2%
SnorkelFinance 2.0 需要取证、分析与合规的财务工作流 Grok 4.6 25.1% / GLM 5.3 21.2% / Grok 4.7 20.2%
SnorkelUnderwrite 2.0 基于不完整分布式证据的可审计核保 Grok 4.7 30.5% / GLM 5.3 30.4% / Nemotron 3 Ultra 30.0%

SWE-bench CLI 的 16.6% 与 DeepSWE 类口径的 74% 至 78% 并不矛盾:后者多为「给定明确改动的定向修复」且常取最优配置;前者要求在真实仓库中完成经多文件验证的变更,且以 pass@1 计。同理,SnorkelUnderwrite 上三强挤在 0.5 分内、而开源权重的 Nemotron 3 Ultra 并列前三——在「证据不完整、要求可审计」这类企业真实约束下,模型间的差距被压缩,工程化配置(证据管线、审计日志)的作用被放大。这正是企业与媒体评测口径分歧的微观样本。

LibraryDesignBench:给别的智能体用的库

Snorkel 于 10 月 1 日重点推介的 LibraryDesignBench 是一个新颖的切面:不评「智能体能否完成任务」,而评「智能体设计的库能否帮其他智能体把活干好」。该基准由 Snorkel 研究员 Gabriel Orlanski(威斯康星大学麦迪逊分校博士生)在 2026 年 9 月 29 日提交的论文中提出,包含 15 个库设计任务与 242 道下游编程题,覆盖 Rust、Python、TypeScript、Haskell 四种语言。

配置 综合分(0-100) 说明
智能体设计库(榜首运行) 48.9(下游通过率 86.6%) 评分同时奖励正确性与下游代码简洁度
人类编写生产库参考 46.6 如 Rust clap、Python pandas 类比的成熟接口
无库参考 34.4 下游智能体从零实现

细节比榜首数字更有信息量:智能体设计者在 15 个任务中的 11 个复现了人类库的抽象,但下游智能体经常「不用」拿到的库,重新实现已有能力——论文把多余代码主要归因于僵化难用的接口,而非功能缺失。更刺眼的对照:某个上榜运行低于「无库参考」,而在 Haskell 上,智能体写的库在 70% 的「设计者-任务」配对中还不如没有库。一个糟糕的抽象会增加而不是减少下游工作量。论文还测试了两种改进(给设计者更明确的面向智能体的指南、允许用子智能体测试设计),均能提升下游得分——这指向可落地的工程实践。需要说明:该基准的 15 个任务远不能代表所有库类型,评分也不涉及库的安全性、性能与可维护性。

三条阅读规则与选型含义

把上述数据放在一起,我们给出评测碎片化时代的三条阅读规则:

  1. 先问口径,再看分数。综合指数(0.01 分的榜首差距)、定向修复基准(74% 档)与全循环工程基准(16% 至 47% 档)测的是三种不同的东西。任何跨榜比较分数的行为,在方法论上已经出错。
  2. 按业务域找分项,别按总分选模型。法务与财务工作流选型应看 SnorkelLegal / SnorkelFinance 而非 Digital Work Index;自主编码选型应看 Agentic Coding 2.0 与 Terminal-Bench 4.0 的组合。Grok 4.6 与 Astra 的翻转画像说明,错误的对标会带来系统性误判。
  3. 警惕评测方与被评方的利益关联。Snorkel 同时是基准组织方与数据服务厂商,Open Benchmarks Grants 计划资助的任务与自身产品线存在叙事协同;厂商自报分则天然偏向自家最优配置。分数本身可复核,但「谁在定义什么算好」值得每次追问。

对企业选型的直接含义:把 2026 年秋的榜单当作「能力地图」而非「排名榜」——先定位自己的任务域,再读对应分项,最后用自己的黄金数据集做闭环验证。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

核心发现

参考来源

  1. Snorkel AI Leaderboard — Digital Work Index / Agentic Coding 2.0 / 分项榜单快照(snorkel.ai/leaderboard,2026.10.02 读取)
  2. Snorkel AI — Agentic Coding 2.0 基准说明页(任务构成、air-gapped 环境与轨迹评分细则)
  3. Web Pulse(wpnews.pro)— Snorkel AI tests whether agents can build libraries other agents can use(2026.10,LibraryDesignBench 论文细节转述,原始论文 2026.09.29 提交)
  4. Orlanski, G. — LibraryDesignBench 论文(2026.09.29 提交,经 Snorkel AI 官方推介与 wpnews.pro 报道交叉)
  5. Snorkel AI Leaderboard — Software Engineering / Knowledge Work 分项页(SWE-bench CLI、WorkplaceAgents、SnorkelFinance 2.0、SnorkelUnderwrite 2.0 快照)