APEX-Agents 测什么:把真实职业搬进沙盒
APEX-Agents 的全称是 AI Productivity Index for Agents,由人才公司 Mercor 构建。其论文开篇的判断与本站多篇文章的立场一致:现有智能体评测普遍任务面窄、人为痕迹重,与专业人士的日常工作方式存在巨大的模拟到现实鸿沟。APEX 的做法是让在职专家——律师、投行分析师、咨询顾问、医生、软件工程师——亲手编写真实职业任务与评分细则(rubric),任务要求智能体在带文件与工具的仿真工作环境里完成多应用、长程的交付物。
任务形态包括:从散落的源文档起草客户备忘录、跨表格重构财务模型、搭建格式一致的交易评审演示文稿、产出经得起复核的带引注法律研究摘要。每份交付物都横跨应用——智能体要经由 MCP 工具在邮件、文档与表格之间穿行,在工具调用出错时自行恢复,并在几十个步骤中保持交付物的完整性。评分采用严格口径:任务只有在其评分细则的每一项测试都通过时才算通过。
同一个名字的数字在三个地方长得完全不同:论文口径(2026 年初,初始 8 智能体榜单,480 任务)天花板 24.0%;Artificial Analysis 独立口径(开源 Stirrup Harness 复跑 452 个公开任务,8 月 7 日快照)榜首 47.1%;Mercor 官方口径(v1.1 版本任务与 Loop Harness)榜首 73.5%。三者任务集、Harness、评分器与时间点都不同,不能互相比较,但并排放在一起恰好构成一条「基准演化曲线」。
口径一:论文基线 — 24% 的初始天花板
论文(arXiv 2601.14242)公开了初始版本的 480 个任务与完整数据集(含提示词、评分细则、参考输出与文件),并同步开源了执行与评测基础设施 Archipelago。初始榜单测了 8 个智能体,Pass@1 成绩如下:
| 智能体(论文初始榜单) | Pass@1 |
|---|---|
| Gemini 3 Flash(Thinking=High) | 24.0% |
| GPT-5.2(Thinking=High) | 23.0% |
| Claude Opus 4.5(Thinking=High) | 18.4% |
| Gemini 3 Pro(Thinking=High) | 18.4% |
| GPT-5(Thinking=High) | 18.3% |
| Grok 4 | 15.2% |
| GPT-OSS-120B(High) | 4.7% |
| Kimi K2 Thinking | 4.0% |
这版榜单的价值在于两个尾部数字:GPT-OSS-120B 与 Kimi K2 Thinking 只有 4.7% 与 4.0%,头部与尾部的差距接近 20 个百分点——说明任务集在测量真实能力差异而非噪声。同时它的 Hugging Face 数据页附带了 95% 置信区间(例如 Gemini 3 Flash 的 24.0% 区间为 20.7–27.3%)与 Pass@8 对照(同模型约 37%),表明单次通过率之外还有可观的「多试即过」空间——这正是长程职业任务「恢复能力重于峰值推理」的统计证据。
口径二:独立镜像 — 47.1% 与 Flash 档的逆袭
Artificial Analysis 用开源的 Stirrup Harness 独立复跑了 APEX-Agents 的 452 个公开任务(沿用 Mercor 原版实现的 MCP 工具管理),每个任务跑三次,形成一条独立的评分序列。其 8 月 7 日快照(经 BenchLM 镜像,覆盖 27 个模型)出现了一个反直觉结果:榜首不是任何旗舰推理模型,而是 Google 的快速低价档 Gemini 3.5 Flash,47.1%,领先 Moonshot Kimi K3(41.3%)与 OpenAI GPT-5.6 Terra(38.9%)。
更有信息量的是纵向对比:四个月前,同一任务集的天花板只有 33.3%;到 8 月,天花板抬升了 13.8 个百分点,而抬升它的恰恰是「小到足够快速迭代」的模型。AgentMarketCap 的解读是迭代经济学:长程职业任务不是单次推理问题,而是文档检索、跨应用编辑与工具调用的长链条,快速便宜的模型能在固定预算内负担更多尝试、更多工具调用与更多自我修正循环。这份数据同时显示:开放权重阵营的最佳成绩(GLM-5.2,33.7%,排名第六)在职业任务上与闭源旗舰的差距,小于在编码基准上的差距;尾部依旧残酷——GPT-OSS 20B 仅 0.7%,头尾相差 46 个百分点。
口径三:官方 v1.1 榜单 — 73.5% 的现在时
Mercor 官方随后发布了 APEX-Agents 1.1:任务规格、工具链与环境全面刷新,评分器用 GEPA 做了优化(官方称之为「智能体验证器也需要基准」),并明确一个重要规则变更——不再奖励不置可否的回答,评分对齐专业人士的真实工作标准。官方当前榜单(Loop Harness,Pass@1,第三方于 9 月 24 日前后的查证快照)如下:
| 模型(官方榜单,Loop Harness) | Pass@1 |
|---|---|
| Claude Opus 5.5(max) | 73.5% |
| Claude Fable 5.1(max) | 68.6% |
| Gemini 3.7 Flash(high) | 67.8% |
| Claude Opus 5(max) | 65.8% |
| Grok 4.6(xhigh) | 65.3% |
| GPT-6 Astra(据 AGI Hunt 转述) | 64.7% |
同一家公司还在官方页面上给出了姊妹基准 APEX-SWE 的对照:Opus 5 以 63.7% 居编码侧榜首,Fable 5.1 以 0.1 个百分点之差紧随;开放权重的最佳成绩是 Kimi K3(APEX-SWE 48.0%、APEX-Agents 50.6%)。两条榜单并读可以看到「编码强者不等于职业任务强者」:编码侧 Anthropic 两款近并列,职业任务侧 Opus 5.5 则以近 5 个百分点明显领先自家 Fable 5.1。
被忽视的变量:推理档位与职业分工
官方榜单里藏着一个比模型更替影响更大的变量:推理档位。据汇编数据,Opus 5.5 在 max 档为 73.5%,而在 medium 档(其 API 默认值)骤降至 52.5%——同一模型同一任务集,档位差 21 个百分点。这与本站 R-BENCH-15 等横评反复验证的结论同向:在长程智能体任务上,「模型的默认交付形态」与「模型的极限能力」是两回事,采购评估若按默认档位测,得到的排名可能与榜单完全不同。
职业分工维度同样值得单列。据 Mercor 榜单的按职业拆分:GPT-6 Astra 在公司法务域以 73.4% 领先,Opus 5.5 在管理咨询域以 80.0% 领先——总分领先者并非每个细分域的领先者。对按场景选型的团队,细分域数据比总分更有参考价值;对基准设计者,这说明「职业任务」不是单一能力轴,而是至少三条(法律、金融、咨询)能力轴的叠加。
如何正确引用这组数字
综合三个口径,本横评给出四条引用规范。其一,任何 APEX 数字必须同时标注版本、Harness 与时间——「APEX-Agents 73.5%」单独出现没有意义,正确写法是「官方 v1.1、Loop Harness、max 档、9 月下旬快照」。其二,三个口径是演化而非矛盾:24%→47%→73.5% 的抬升,分别来自模型进步、独立 Harness 复跑与官方 Harness/评分器升级,把它当成「同一个基准上模型变强三倍」来叙事是错误的。其三,档位是隐性变量:max 档与默认档 21 个百分点的差距意味着,任何未标注推理档位的引用都不可比。其四,官方数字与独立镜像数字应分开引用——前者代表厂商口径下的当前上限,后者代表开源环境下第三方可复现的成绩,两者的差距本身就是「Harness 贡献」的量度。至于 v1.1 任务集的完整规模、官方评分器的 GEPA 优化细节与按职业拆分的全量数据,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。