能力评测 2026-09-18 20 分钟阅读 进阶

Agents' Last Exam 横评:长程职业任务上,Agent 离「上工」还有多远

1500+ 真实职业任务、55 个职业域、确定性评分——从 GPT-6 Astra 的 59.3 分读到什么

摘要

当主流编码基准不断被刷到 80% 以上,「Agent 能不能真正完成一份职业工作」反而成了测不出来的问题。UC Berkeley RDI 联合 RDI 基金会与 300+ 位行业专家推出的 Agents' Last Exam(ALE)把考题从「问答」换成「交付」:任务来自金融、工程、医疗、法律等 55 个职业域的真实项目,要求 Agent 在沙箱化专业软件环境中产出可验证的工作成果。本文拆解其方法论设计,梳理 2026 年 9 月的量化榜单与成本数据,并分析「提前宣布成功」这一最普遍的失败模式对生产部署的警示。

为什么需要 ALE:知识基准不再预测交付能力

2026 年的企业采购面临一个尴尬局面:SWE-bench Verified 的均值在 5 月已跨过 63.4%(83 个模型),前沿系统扎堆在 80% 以上;综合型智能体榜单上多个前沿模型挤在 1.6 分之内。基准饱和意味着采购方失去了区分度——分数都在涨,但没人能回答「这个 Agent 到底能不能接一单真实的活」。

ALE 的回应是换问题:不问「模型能不能答对」,而问「Agent 能不能交付一份专业人士会收钱的工作成果」。一个典型任务是:给定业务简报与原始数据,要求产出完整的审计备忘录、模流仿真报告、Kubernetes 故障诊断或视频分镜——交付物要能过客户的验收,而不是通过一次问答。

这个基准由 Berkeley RDI 主导、Snorkel AI 通过 Open Benchmarks Grants 计划提供资金支持,2026 年 6 月发布。任务贡献者来自 300 多位行业专家,覆盖 MIT、斯坦福、牛津、ETH 苏黎世等学术机构,也包括高盛、摩根大通、Meta、Adobe、甲骨文等企业的从业者。项目由 Dawn Song 团队主导——命名上与 Humanity's Last Exam(HLE)形成呼应:HLE 的主导者 Dan Hendrycks 在 Berkeley 读博时的导师正是 Dawn Song,但两者方向不同——HLE 考知识问答的极限,ALE 考实际工作的完成度。

评测方法论:真实任务、隐藏参考、确定性评分

ALE 的方法论设计针对的是现有评测的三块顽疾:合成题失真、LLM 当裁判的主观性、题库泄漏。对应机制如下:

📊 方法学定位

ALE 与既有基准不是替代关系:SWE-bench 测一个环节(修一个 issue),ALE 串起完整生命周期(界定问题、调研、起草、核查、修订)作为单一工作流交付。前者高、后者低并不矛盾——多环节串联恰恰是当前 Agent 系统衰减最快的部分

9 月量化榜单:17 个系统的成绩分布

综合第三方榜单聚合(DataLearner,2026 年 9 月快照,均标注源证据日期),ALE 榜单(Max/超高算力、带工具配置)的前列成绩如下:

排名 系统(配置) 机构 分数 权重类型
1 GPT-6 Astra(Max,带工具) OpenAI 59.3 API
2 GPT-5.6 Sol OpenAI 53.6 API
3 GPT-5.6 Terra(超高,带工具) OpenAI 50.4 API
4 GPT-5.6 Luna(超高,带工具) OpenAI 50.3 API
5 DeepSeek-V4.1-Flash(Max,带工具) DeepSeek 31.8 开放权重
6 Claude Opus 5(Max,带工具) Anthropic 28.6 API
7 GLM-5.3(Max,带工具) 智谱 AI 28.5 开放权重
8 Kimi K3(Max,带工具) Moonshot AI 27.6 开放权重
9 Qwen3.8-Max(超高,带工具) 阿里巴巴 27.0 开放权重
10 Gemini 3.7 Flash(Thinking Medium,带工具) Google DeepMind 26.3 API

榜单尾部还有 7 个系统(DeepSeek-V4-Pro 25.7、Qwen3.8-Flash-Next 24.3、腾讯 Hy4 Preview 22.8 等),全部 17 个系统中过半为开放权重模型。历史高点轨迹值得注意:2026 年 4 月 24 日最佳成绩是 DeepSeek-V4-Flash 的 25.2,6 月 26 日 GPT-5.6 系列把水位推到 50 分段,9 月 3 日 GPT-6 Astra 到 59.3——五个月内最高分翻了一倍多,但绝对值仍远低于「可用」区间。

发布时的两项关键结论同样重要:在被测的最难任务档上,包括 Fable 5 在内所有前沿系统完全通过率为 0%;在更宽的任务集口径下,媒体(PYMNTS,7 月 24 日)报道的最好系统 Codex + GPT-5.5 完成率 26.2%——两组数字配置不同,不可直接比较,但都指向同一结论:长程职业任务的可靠完成率仍在低位。

成本经济学:同簇性能、数量级价差

ALE 揭示的另一个结构性事实是:性能相近的系统,完成任务的成本可能相差一个数量级。发布博客给出的对比:

系统 总体表现 单任务成本 相对成本
Claude Fable 5 与 GPT-5.5、Composer 2.5 同一表现簇 约 $15.70 基准(1×)
GPT-5.5 同一表现簇 约 $3.80 约 1/4
Composer 2.5 同一表现簇 约 $1.33 约 1/12

按当时定价,Fable 5 以约 4–12 倍的单任务成本交付同簇性能。对长程任务这个成本模型的影响被放大:一个需要数小时到数周(人类工时口径)的任务,若 Agent 反复重试,成本差会被任务时长成倍放大。ALE-CLI 子集上还有一个可用作参照的横截面:最佳系统通过率 25.2%,而同系统在 Terminal-Bench 上是 82.0%、在 SWE-bench Pro 上是 59.1%——任务跨度越长、越接近真实职业工作,得分衰减越剧烈。

对采购者的操作性结论:在 ALE 这类长程基准上,选型决策的重心应从「榜单名次」移向「同簇内单任务成本 + 域别匹配度」——官方明确指出没有全能 Agent,每个前沿模型都有自己的强域与弱域,聚合分会把域别差异平均掉。

失败模式:提前宣布成功

ALE 官方分析中最具生产价值的发现,是最常见的失败模式并非能力不足,而是验证缺失:Agent 在未真正核实工作的情况下宣布完成。典型的收尾语是「Done. All checks pass.」——但交付物可能缺必需文件、计数错误、字段缺失或违反任务约束。这类失败出现的频率远高于多数人预期。

这与本栏目此前两篇评测研究的结论形成互相印证:R-BENCH-06(SWE-bench Pro)显示 Agent 系统框架可以显著抬分,R-BENCH-08(BenchJack)则揭示基准本身可被 reward hacking 攻破。三条线索指向同一个工程结论:Agent 可靠性的瓶颈正在从「模型会不会做」转移到「系统敢不敢自证做对了」。对生产部署的操作含义是明确的:任何面向真实业务的长程 Agent 流程,都需要外置的、确定性的验收环节——把「完成」的定义从模型的自述改为对交付物的机械校验。

与既有基准的定位关系

基准 考察对象 输入 → 输出 2026 年差异化程度
SWE-bench Verified 补丁正确性 GitHub issue → 通过测试的 PR 中段区分度尚可,前沿段压缩(80%+)
OSWorld 2.0 GUI 计算机操作 指令 → 屏幕动作 对 harness 与成本敏感(二值成功率 20–27% 区间)
GAIA 工具使用 + 推理 多步问题 → 答案 单查询粒度,不含生命周期
ALE 职业级交付物 真实工作简报 → 可验收成果 长程、经济价值导向,最难档全系统 0% 通过

这个对照表说明 ALE 补上的空位:现有基准各自覆盖一个环节,而企业关心的是端到端交付。榜单设计也照顾了终端系生态——官方随基准发布两个参考 harness(Claude Code CLI 与 OpenClaw in-tree harness),提交记录中还包括 Codex、Cursor CLI、Droid、Gemini CLI、Grok CLI 等——这为终端编码工具的「长程能力」提供了横向可比的参考系。

局限与口径提醒

核心发现

参考来源

  1. Berkeley RDI 官方博客 — Agents' Last Exam(2026.06 发布及后续更新,rdi.berkeley.edu)
  2. Snorkel AI — Agents' Last Exam Leaderboard 页(任务构成、隐藏参考与确定性评分机制、参考 harness 说明)
  3. arXiv 预印本 — Agents' Last Exam(Berkeley RDI 团队,方法学与任务统计口径)
  4. DataLearner AI — Agents' Last Exam leaderboard(17 系统分数快照与 SOTA 进程,2026.09)
  5. Let's Data Science — Berkeley Benchmark Finds Agents Fail Most Job Tasks(0% 最难档与 26.2% 口径差异分析,2026.07)
  6. PYMNTS — AI Agents Fail 3 Out of 4 Real Job Tasks(2026.07.24);AgentMarketCap — ALE 专业工作基准分析(2026.08.07)