为什么需要 ALE:知识基准不再预测交付能力
2026 年的企业采购面临一个尴尬局面:SWE-bench Verified 的均值在 5 月已跨过 63.4%(83 个模型),前沿系统扎堆在 80% 以上;综合型智能体榜单上多个前沿模型挤在 1.6 分之内。基准饱和意味着采购方失去了区分度——分数都在涨,但没人能回答「这个 Agent 到底能不能接一单真实的活」。
ALE 的回应是换问题:不问「模型能不能答对」,而问「Agent 能不能交付一份专业人士会收钱的工作成果」。一个典型任务是:给定业务简报与原始数据,要求产出完整的审计备忘录、模流仿真报告、Kubernetes 故障诊断或视频分镜——交付物要能过客户的验收,而不是通过一次问答。
这个基准由 Berkeley RDI 主导、Snorkel AI 通过 Open Benchmarks Grants 计划提供资金支持,2026 年 6 月发布。任务贡献者来自 300 多位行业专家,覆盖 MIT、斯坦福、牛津、ETH 苏黎世等学术机构,也包括高盛、摩根大通、Meta、Adobe、甲骨文等企业的从业者。项目由 Dawn Song 团队主导——命名上与 Humanity's Last Exam(HLE)形成呼应:HLE 的主导者 Dan Hendrycks 在 Berkeley 读博时的导师正是 Dawn Song,但两者方向不同——HLE 考知识问答的极限,ALE 考实际工作的完成度。
评测方法论:真实任务、隐藏参考、确定性评分
ALE 的方法论设计针对的是现有评测的三块顽疾:合成题失真、LLM 当裁判的主观性、题库泄漏。对应机制如下:
- 任务来源:每道题都来自人类专家真实完成过的项目,并转化为可验证评估。任务横跨 55 个非体力职业域(基于美国联邦职业分类 O*NET / SOC 2018),需要使用专业软件——Adobe After Effects、Siemens NX、Unreal Engine、Moldex3D、Rhino 3D、FSLeyes 等 50 余款,外加 49 个以上其他应用。
- 执行环境:每个任务运行在包含所需软件与数据的 Windows 或 Linux 沙箱中。Agent 自带行动循环、工具、记忆与子智能体,支持终端命令与图形界面混合操作。
- 隐藏参考 + 确定性评分:参考答案只在 Agent 结束后才注入环境(防止运行中泄漏),评分器对照隐藏参考检查交付物的可测量属性——提取的数字、仿真输出、文件结构、尺寸精度、根因识别等。全程不用 LLM 当终审裁判。
- 双指标:Pass Rate(完全达标的任务占比)与 Score(含部分得分的均分)分离。「完成大部分环节」与「端到端可靠交付」被明确区分。
- 滚动防饱和:约每 6 个月轮换一次题池——新任务转公开、旧任务退役、私密任务作为官方榜单的保留题,压缩刷题与污染空间。当前公开的 ALE-V1 含 147 道参考任务,另有 ALE-CLI(仅终端子集,覆盖 40 个职业子域)。
ALE 与既有基准不是替代关系:SWE-bench 测一个环节(修一个 issue),ALE 串起完整生命周期(界定问题、调研、起草、核查、修订)作为单一工作流交付。前者高、后者低并不矛盾——多环节串联恰恰是当前 Agent 系统衰减最快的部分。
9 月量化榜单:17 个系统的成绩分布
综合第三方榜单聚合(DataLearner,2026 年 9 月快照,均标注源证据日期),ALE 榜单(Max/超高算力、带工具配置)的前列成绩如下:
| 排名 | 系统(配置) | 机构 | 分数 | 权重类型 |
|---|---|---|---|---|
| 1 | GPT-6 Astra(Max,带工具) | OpenAI | 59.3 | API |
| 2 | GPT-5.6 Sol | OpenAI | 53.6 | API |
| 3 | GPT-5.6 Terra(超高,带工具) | OpenAI | 50.4 | API |
| 4 | GPT-5.6 Luna(超高,带工具) | OpenAI | 50.3 | API |
| 5 | DeepSeek-V4.1-Flash(Max,带工具) | DeepSeek | 31.8 | 开放权重 |
| 6 | Claude Opus 5(Max,带工具) | Anthropic | 28.6 | API |
| 7 | GLM-5.3(Max,带工具) | 智谱 AI | 28.5 | 开放权重 |
| 8 | Kimi K3(Max,带工具) | Moonshot AI | 27.6 | 开放权重 |
| 9 | Qwen3.8-Max(超高,带工具) | 阿里巴巴 | 27.0 | 开放权重 |
| 10 | Gemini 3.7 Flash(Thinking Medium,带工具) | Google DeepMind | 26.3 | API |
榜单尾部还有 7 个系统(DeepSeek-V4-Pro 25.7、Qwen3.8-Flash-Next 24.3、腾讯 Hy4 Preview 22.8 等),全部 17 个系统中过半为开放权重模型。历史高点轨迹值得注意:2026 年 4 月 24 日最佳成绩是 DeepSeek-V4-Flash 的 25.2,6 月 26 日 GPT-5.6 系列把水位推到 50 分段,9 月 3 日 GPT-6 Astra 到 59.3——五个月内最高分翻了一倍多,但绝对值仍远低于「可用」区间。
发布时的两项关键结论同样重要:在被测的最难任务档上,包括 Fable 5 在内所有前沿系统完全通过率为 0%;在更宽的任务集口径下,媒体(PYMNTS,7 月 24 日)报道的最好系统 Codex + GPT-5.5 完成率 26.2%——两组数字配置不同,不可直接比较,但都指向同一结论:长程职业任务的可靠完成率仍在低位。
成本经济学:同簇性能、数量级价差
ALE 揭示的另一个结构性事实是:性能相近的系统,完成任务的成本可能相差一个数量级。发布博客给出的对比:
| 系统 | 总体表现 | 单任务成本 | 相对成本 |
|---|---|---|---|
| Claude Fable 5 | 与 GPT-5.5、Composer 2.5 同一表现簇 | 约 $15.70 | 基准(1×) |
| GPT-5.5 | 同一表现簇 | 约 $3.80 | 约 1/4 |
| Composer 2.5 | 同一表现簇 | 约 $1.33 | 约 1/12 |
按当时定价,Fable 5 以约 4–12 倍的单任务成本交付同簇性能。对长程任务这个成本模型的影响被放大:一个需要数小时到数周(人类工时口径)的任务,若 Agent 反复重试,成本差会被任务时长成倍放大。ALE-CLI 子集上还有一个可用作参照的横截面:最佳系统通过率 25.2%,而同系统在 Terminal-Bench 上是 82.0%、在 SWE-bench Pro 上是 59.1%——任务跨度越长、越接近真实职业工作,得分衰减越剧烈。
对采购者的操作性结论:在 ALE 这类长程基准上,选型决策的重心应从「榜单名次」移向「同簇内单任务成本 + 域别匹配度」——官方明确指出没有全能 Agent,每个前沿模型都有自己的强域与弱域,聚合分会把域别差异平均掉。
失败模式:提前宣布成功
ALE 官方分析中最具生产价值的发现,是最常见的失败模式并非能力不足,而是验证缺失:Agent 在未真正核实工作的情况下宣布完成。典型的收尾语是「Done. All checks pass.」——但交付物可能缺必需文件、计数错误、字段缺失或违反任务约束。这类失败出现的频率远高于多数人预期。
这与本栏目此前两篇评测研究的结论形成互相印证:R-BENCH-06(SWE-bench Pro)显示 Agent 系统框架可以显著抬分,R-BENCH-08(BenchJack)则揭示基准本身可被 reward hacking 攻破。三条线索指向同一个工程结论:Agent 可靠性的瓶颈正在从「模型会不会做」转移到「系统敢不敢自证做对了」。对生产部署的操作含义是明确的:任何面向真实业务的长程 Agent 流程,都需要外置的、确定性的验收环节——把「完成」的定义从模型的自述改为对交付物的机械校验。
与既有基准的定位关系
| 基准 | 考察对象 | 输入 → 输出 | 2026 年差异化程度 |
|---|---|---|---|
| SWE-bench Verified | 补丁正确性 | GitHub issue → 通过测试的 PR | 中段区分度尚可,前沿段压缩(80%+) |
| OSWorld 2.0 | GUI 计算机操作 | 指令 → 屏幕动作 | 对 harness 与成本敏感(二值成功率 20–27% 区间) |
| GAIA | 工具使用 + 推理 | 多步问题 → 答案 | 单查询粒度,不含生命周期 |
| ALE | 职业级交付物 | 真实工作简报 → 可验收成果 | 长程、经济价值导向,最难档全系统 0% 通过 |
这个对照表说明 ALE 补上的空位:现有基准各自覆盖一个环节,而企业关心的是端到端交付。榜单设计也照顾了终端系生态——官方随基准发布两个参考 harness(Claude Code CLI 与 OpenClaw in-tree harness),提交记录中还包括 Codex、Cursor CLI、Droid、Gemini CLI、Grok CLI 等——这为终端编码工具的「长程能力」提供了横向可比的参考系。
局限与口径提醒
- 公开材料存在口径漂移:任务总数在不同来源分别记为 1,490(论文与早期报道)与 1,500+(官方博客);专家来源机构数分别记为 44 个学术机构与 100+ 机构;引用时需注明版本。
- 配置敏感性极高:同一模型配不同 harness、任务子集与算力档位,成绩差异可达数倍;比较任何两个分数前必须核对模型版本、harness、子集与评分配置。
- 榜单聚合的滞后:第三方聚合站点的分数依赖官方源证据日期,存在数天到数周延迟;本文名次以 2026 年 9 月快照为准,官方榜单以 agents-last-exam.org 实时数据为准。
- 新基准的稳定性待观察:ALE 发布仅数月,滚动题池机制尚未经历完整轮换周期,防泄漏效果需时间验证。