Humanity's Last Exam(人类最后的考试)
| 分类 | 📊 评测基准 |
| 阅读时间 | ⏱️ 17 分钟 |
| 更新时间 | 📅 2026-10-05 |
| 条目编号 | ENC-BENCH-19-humanitys-last-exam |
关键要点 ✦
- 数据构成:约 76% 为需要精确作答的短答题,约 24% 为选择题;题源覆盖数学、物理、工程、人文等上百个学科,另设私有保留集用于检测记忆化(据 Scale AI 官方发布与 Artificial Analysis 说明)。
- 于 2025 年 1 月 24 日正式发布,发布时多数前沿模型得分仅个位数到十几分,与人类专家表现差距悬殊,因而被广泛用作知识推理上限的探针。
- 至 2026 年 10 月,头部系统的公开配置得分已进入约 55% 至 61% 区间:据第三方聚合镜像 2026-10-02 快照,Scale 榜单公开配置下 GPT-6 Astra 报 60.6%、Claude Opus 5.5 报 55%;不同评测口径(是否带工具、推理档位、数据划分)的结果不可直接互比。
- 评测口径多样:闭卷纯文本与带工具(搜索、代码执行)配置分别计分;聚合平台普遍提示部分分数为厂商自报,引用时需区分官方榜单、第三方复测与自报三类证据等级。
- 局限明确:题目公开发布后面临训练数据污染风险,部分学科样本量偏少,且对智能体工具使用的区分度有限——它衡量的是「知识推理」而非「自主执行」。
构建缘起与数据规模
随着 MMLU、GPQA 等既有基准陆续被前沿模型逼近或突破饱和,学术界与评测社区需要一套难度真正贴近人类知识边界的题目。CAIS 与 Scale AI 以全球公开征集的方式,从约 1000 名涵盖 500 多家机构、50 个国家的专家手中收集题目,经评审筛除歧义题与可被搜索引擎直接命中的题,最终形成约 2500 道闭式问题,于 2025 年 1 月 24 日发布。
题目形态刻意偏向「可客观判定」:约四分之三为需要精确最终答案的短答题,其余为选择题。项目同时保留了一批不对外公开的私有题,用于比对模型在公开题与陌生题上的表现差异,以此估计记忆化污染的程度。
评分口径与榜单现状
HLE 的分数高度依赖评测配置:同一模型在闭卷纯文本、允许搜索、允许代码执行等不同设定下得分差距显著;推理档位(思考预算)与候选答案采样策略也会带来数个百分点的波动。Scale 官方榜单与 Artificial Analysis、各类聚合平台因此都要求按完整配置呈现结果。
据第三方聚合镜像 2026 年 10 月 2 日的快照,公开配置下 GPT-6 Astra 报 60.6%,Claude Opus 5.5 报 55%,多款头部闭源模型集中在 34% 至 55% 区间,开放权重模型与闭源头部的差距仍明显。需要强调的是,这些数字来自不同主体、不同配置的自报或复测,只能作为量级参考。
与其他基准的定位差异
与 MMLU 这类「广度覆盖、难度中等」的知识基准相比,HLE 把难度推到学科专家也需费力作答的深度;与 GPQA 相比,两者同样主打研究生级科学问题,但 HLE 的学科范围更广、题量更大;与 BrowseComp、SWE-bench 等智能体基准相比,HLE 衡量的是静态知识推理而非多步工具执行——它在智能体评测谱系中的位置,类似于「智力考卷」而非「实操考场」。
因此实践中的常见做法是把 HLE 与智能体基准搭配使用:前者回答「模型的推理天花板有多高」,后者回答「模型装上工具与外壳后能完成多少真实任务」。
局限与社区批评
HLE 面临的批评集中在三点。其一是饱和与污染的赛跑:公开题目终将进入训练语料,私有保留集能缓解但无法根除;其二是学科分布不均,部分小众领域题目过少,单题对错对总分影响过大;其三是口径混乱,厂商自报分数所用的配置常不透明,跨模型比较容易失真。
这些问题并非 HLE 特有,而是所有公开静态基准的共同宿命。社区的应对方向包括:保留集常态化比对、按配置强制披露、以及把评测重心逐步转向可在线重生成的智能体化基准。
🎯 应用场景
✅ 最佳实践
- 引用分数时必须注明评测配置:是否带工具、推理档位、数据划分与分数来源(官方榜单、第三方复测或厂商自报)。
- 不要用单一基准分数下结论;将 HLE 与智能体执行类基准搭配,形成「推理上限 + 实操能力」的完整画像。
- 跨模型比较时优先选用同一评测方、同一配置的成对结果,避免把不同口径的数字直接排序。
- 关注私有保留集结果与公开题结果的差异,作为估计记忆化污染的依据。
🔮 未来展望
HLE 的分数曲线仍在快速抬升,头部系统与饱和线的距离已缩短到约四成。照此速度,公开题集将在可见的将来失去区分度,社区的关注点预计将进一步转向私有保留集、按配置透明化披露,以及可在线重生成、面向智能体工作流的下一代评测形态。后续将持续跟进迭代动态。