能力评测 2026-09-26 25 分钟阅读 进阶

APEX-Agents 三口径评测:职业任务智能体基准的天花板为何相差近三倍

从论文 24%、独立镜像 47.1% 到官方榜单 73.5% — 同一个基准的三张面孔,以及推理档位 21 个百分点的隐性变量

摘要

Mercor 的 APEX-Agents 是目前离真实商业自动化最近的公开基准之一:任务由投行分析师、咨询顾问与公司法务亲手编写,要求智能体跨邮件、文档、表格等多应用完成长程专业工作。但围绕它的公开数字存在三个量级不同的口径——论文初始榜单的天花板是 24.0%,Artificial Analysis 独立镜像的榜首是 47.1%,官方当前榜单的榜首则是 73.5%。本文把三个口径放回各自的任务版本、Harness 与时间线中拆解,并给出两个横评结论:职业任务基准上 Harness 与推理档位的影响远超模型更替;按职业分工看,各家模型的优势域并不重合。

APEX-Agents 测什么:把真实职业搬进沙盒

APEX-Agents 的全称是 AI Productivity Index for Agents,由人才公司 Mercor 构建。其论文开篇的判断与本站多篇文章的立场一致:现有智能体评测普遍任务面窄、人为痕迹重,与专业人士的日常工作方式存在巨大的模拟到现实鸿沟。APEX 的做法是让在职专家——律师、投行分析师、咨询顾问、医生、软件工程师——亲手编写真实职业任务与评分细则(rubric),任务要求智能体在带文件与工具的仿真工作环境里完成多应用、长程的交付物。

任务形态包括:从散落的源文档起草客户备忘录、跨表格重构财务模型、搭建格式一致的交易评审演示文稿、产出经得起复核的带引注法律研究摘要。每份交付物都横跨应用——智能体要经由 MCP 工具在邮件、文档与表格之间穿行,在工具调用出错时自行恢复,并在几十个步骤中保持交付物的完整性。评分采用严格口径:任务只有在其评分细则的每一项测试都通过时才算通过。

📏 一个基准,三个口径

同一个名字的数字在三个地方长得完全不同:论文口径(2026 年初,初始 8 智能体榜单,480 任务)天花板 24.0%;Artificial Analysis 独立口径(开源 Stirrup Harness 复跑 452 个公开任务,8 月 7 日快照)榜首 47.1%;Mercor 官方口径(v1.1 版本任务与 Loop Harness)榜首 73.5%。三者任务集、Harness、评分器与时间点都不同,不能互相比较,但并排放在一起恰好构成一条「基准演化曲线」。

口径一:论文基线 — 24% 的初始天花板

论文(arXiv 2601.14242)公开了初始版本的 480 个任务与完整数据集(含提示词、评分细则、参考输出与文件),并同步开源了执行与评测基础设施 Archipelago。初始榜单测了 8 个智能体,Pass@1 成绩如下:

智能体(论文初始榜单) Pass@1
Gemini 3 Flash(Thinking=High)24.0%
GPT-5.2(Thinking=High)23.0%
Claude Opus 4.5(Thinking=High)18.4%
Gemini 3 Pro(Thinking=High)18.4%
GPT-5(Thinking=High)18.3%
Grok 415.2%
GPT-OSS-120B(High)4.7%
Kimi K2 Thinking4.0%

这版榜单的价值在于两个尾部数字:GPT-OSS-120B 与 Kimi K2 Thinking 只有 4.7% 与 4.0%,头部与尾部的差距接近 20 个百分点——说明任务集在测量真实能力差异而非噪声。同时它的 Hugging Face 数据页附带了 95% 置信区间(例如 Gemini 3 Flash 的 24.0% 区间为 20.7–27.3%)与 Pass@8 对照(同模型约 37%),表明单次通过率之外还有可观的「多试即过」空间——这正是长程职业任务「恢复能力重于峰值推理」的统计证据。

口径二:独立镜像 — 47.1% 与 Flash 档的逆袭

Artificial Analysis 用开源的 Stirrup Harness 独立复跑了 APEX-Agents 的 452 个公开任务(沿用 Mercor 原版实现的 MCP 工具管理),每个任务跑三次,形成一条独立的评分序列。其 8 月 7 日快照(经 BenchLM 镜像,覆盖 27 个模型)出现了一个反直觉结果:榜首不是任何旗舰推理模型,而是 Google 的快速低价档 Gemini 3.5 Flash,47.1%,领先 Moonshot Kimi K3(41.3%)与 OpenAI GPT-5.6 Terra(38.9%)。

更有信息量的是纵向对比:四个月前,同一任务集的天花板只有 33.3%;到 8 月,天花板抬升了 13.8 个百分点,而抬升它的恰恰是「小到足够快速迭代」的模型。AgentMarketCap 的解读是迭代经济学:长程职业任务不是单次推理问题,而是文档检索、跨应用编辑与工具调用的长链条,快速便宜的模型能在固定预算内负担更多尝试、更多工具调用与更多自我修正循环。这份数据同时显示:开放权重阵营的最佳成绩(GLM-5.2,33.7%,排名第六)在职业任务上与闭源旗舰的差距,小于在编码基准上的差距;尾部依旧残酷——GPT-OSS 20B 仅 0.7%,头尾相差 46 个百分点。

口径三:官方 v1.1 榜单 — 73.5% 的现在时

Mercor 官方随后发布了 APEX-Agents 1.1:任务规格、工具链与环境全面刷新,评分器用 GEPA 做了优化(官方称之为「智能体验证器也需要基准」),并明确一个重要规则变更——不再奖励不置可否的回答,评分对齐专业人士的真实工作标准。官方当前榜单(Loop Harness,Pass@1,第三方于 9 月 24 日前后的查证快照)如下:

模型(官方榜单,Loop Harness) Pass@1
Claude Opus 5.5(max)73.5%
Claude Fable 5.1(max)68.6%
Gemini 3.7 Flash(high)67.8%
Claude Opus 5(max)65.8%
Grok 4.6(xhigh)65.3%
GPT-6 Astra(据 AGI Hunt 转述)64.7%

同一家公司还在官方页面上给出了姊妹基准 APEX-SWE 的对照:Opus 5 以 63.7% 居编码侧榜首,Fable 5.1 以 0.1 个百分点之差紧随;开放权重的最佳成绩是 Kimi K3(APEX-SWE 48.0%、APEX-Agents 50.6%)。两条榜单并读可以看到「编码强者不等于职业任务强者」:编码侧 Anthropic 两款近并列,职业任务侧 Opus 5.5 则以近 5 个百分点明显领先自家 Fable 5.1。

被忽视的变量:推理档位与职业分工

官方榜单里藏着一个比模型更替影响更大的变量:推理档位。据汇编数据,Opus 5.5 在 max 档为 73.5%,而在 medium 档(其 API 默认值)骤降至 52.5%——同一模型同一任务集,档位差 21 个百分点。这与本站 R-BENCH-15 等横评反复验证的结论同向:在长程智能体任务上,「模型的默认交付形态」与「模型的极限能力」是两回事,采购评估若按默认档位测,得到的排名可能与榜单完全不同。

职业分工维度同样值得单列。据 Mercor 榜单的按职业拆分:GPT-6 Astra 在公司法务域以 73.4% 领先,Opus 5.5 在管理咨询域以 80.0% 领先——总分领先者并非每个细分域的领先者。对按场景选型的团队,细分域数据比总分更有参考价值;对基准设计者,这说明「职业任务」不是单一能力轴,而是至少三条(法律、金融、咨询)能力轴的叠加。

如何正确引用这组数字

综合三个口径,本横评给出四条引用规范。其一,任何 APEX 数字必须同时标注版本、Harness 与时间——「APEX-Agents 73.5%」单独出现没有意义,正确写法是「官方 v1.1、Loop Harness、max 档、9 月下旬快照」。其二,三个口径是演化而非矛盾:24%→47%→73.5% 的抬升,分别来自模型进步、独立 Harness 复跑与官方 Harness/评分器升级,把它当成「同一个基准上模型变强三倍」来叙事是错误的。其三,档位是隐性变量:max 档与默认档 21 个百分点的差距意味着,任何未标注推理档位的引用都不可比。其四,官方数字与独立镜像数字应分开引用——前者代表厂商口径下的当前上限,后者代表开源环境下第三方可复现的成绩,两者的差距本身就是「Harness 贡献」的量度。至于 v1.1 任务集的完整规模、官方评分器的 GEPA 优化细节与按职业拆分的全量数据,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

核心发现

参考来源

  1. arXiv 2601.14242 — APEX-Agents 论文(初始 8 智能体榜单、480 任务开源口径、Archipelago 基础设施;2026.09.26 查证)
  2. Mercor 官方资源页 — Best AI Models Right Now(APEX-Agents 与 APEX-SWE 官方榜单、Harness 口径、开放权重最佳成绩与选型建议)
  3. AgentMarketCap — Gemini 3.5 Flash Leads APEX-Agents-AA at 47.1%(Artificial Analysis 独立镜像方法学、8 月快照 27 模型完整数据、迭代经济学解读)
  4. Fleece AI — AI Agent Benchmarks 2026 Explained(官方榜单 9 月 24 日快照、effort 档位对照、按职业拆分数据与基准退役时间线)
  5. AGI Hunt — APEX-Agents 1.1 benchmark update(v1.1 规则变更、GEPA 评分器优化与 GPT-6 Astra 64.7% 口径)
  6. Hugging Face Datasets — mercor/apex-agents(95% 置信区间、Pass@8 与分职业 Pass@1 的原始数据页)