📊 评测基准

Humanity's Last Exam(人类最后的考试)

别名:HLEHumanity's Last Exam人类最后的考试HLE 基准HLE Benchmark
分类📊 评测基准
阅读时间⏱️ 17 分钟
更新时间📅 2026-10-05
条目编号ENC-BENCH-19-humanitys-last-exam
由 Center for AI Safety(CAIS)与 Scale AI 联合构建的专家级学术问答基准,汇集约 1000 名来自 500 多家机构、50 个国家的专家贡献的约 2500 道跨学科高难度闭式问题,用于衡量前沿模型在人类知识边界处的推理能力。

关键要点 ✦

构建缘起与数据规模

随着 MMLU、GPQA 等既有基准陆续被前沿模型逼近或突破饱和,学术界与评测社区需要一套难度真正贴近人类知识边界的题目。CAIS 与 Scale AI 以全球公开征集的方式,从约 1000 名涵盖 500 多家机构、50 个国家的专家手中收集题目,经评审筛除歧义题与可被搜索引擎直接命中的题,最终形成约 2500 道闭式问题,于 2025 年 1 月 24 日发布。

题目形态刻意偏向「可客观判定」:约四分之三为需要精确最终答案的短答题,其余为选择题。项目同时保留了一批不对外公开的私有题,用于比对模型在公开题与陌生题上的表现差异,以此估计记忆化污染的程度。

评分口径与榜单现状

HLE 的分数高度依赖评测配置:同一模型在闭卷纯文本、允许搜索、允许代码执行等不同设定下得分差距显著;推理档位(思考预算)与候选答案采样策略也会带来数个百分点的波动。Scale 官方榜单与 Artificial Analysis、各类聚合平台因此都要求按完整配置呈现结果。

据第三方聚合镜像 2026 年 10 月 2 日的快照,公开配置下 GPT-6 Astra 报 60.6%,Claude Opus 5.5 报 55%,多款头部闭源模型集中在 34% 至 55% 区间,开放权重模型与闭源头部的差距仍明显。需要强调的是,这些数字来自不同主体、不同配置的自报或复测,只能作为量级参考。

与其他基准的定位差异

与 MMLU 这类「广度覆盖、难度中等」的知识基准相比,HLE 把难度推到学科专家也需费力作答的深度;与 GPQA 相比,两者同样主打研究生级科学问题,但 HLE 的学科范围更广、题量更大;与 BrowseComp、SWE-bench 等智能体基准相比,HLE 衡量的是静态知识推理而非多步工具执行——它在智能体评测谱系中的位置,类似于「智力考卷」而非「实操考场」。

因此实践中的常见做法是把 HLE 与智能体基准搭配使用:前者回答「模型的推理天花板有多高」,后者回答「模型装上工具与外壳后能完成多少真实任务」。

局限与社区批评

HLE 面临的批评集中在三点。其一是饱和与污染的赛跑:公开题目终将进入训练语料,私有保留集能缓解但无法根除;其二是学科分布不均,部分小众领域题目过少,单题对错对总分影响过大;其三是口径混乱,厂商自报分数所用的配置常不透明,跨模型比较容易失真。

这些问题并非 HLE 特有,而是所有公开静态基准的共同宿命。社区的应对方向包括:保留集常态化比对、按配置强制披露、以及把评测重心逐步转向可在线重生成的智能体化基准。

🎯 应用场景

前沿模型能力对比
作为知识推理维度的横向参考,配合配置说明比较不同实验室模型的上限能力。
实验室发布评估
新模型发布时的标准评测项之一,用于向公众说明模型在人类知识边界处的表现。
记忆化与污染研究
利用公开题与私有保留集的分数差,研究训练数据污染对评测结果的影响。
推理技术研究
评估长思考预算、测试时计算扩展等推理技术在高难度学术问题上的边际收益。

✅ 最佳实践

  • 引用分数时必须注明评测配置:是否带工具、推理档位、数据划分与分数来源(官方榜单、第三方复测或厂商自报)。
  • 不要用单一基准分数下结论;将 HLE 与智能体执行类基准搭配,形成「推理上限 + 实操能力」的完整画像。
  • 跨模型比较时优先选用同一评测方、同一配置的成对结果,避免把不同口径的数字直接排序。
  • 关注私有保留集结果与公开题结果的差异,作为估计记忆化污染的依据。

🔮 未来展望

HLE 的分数曲线仍在快速抬升,头部系统与饱和线的距离已缩短到约四成。照此速度,公开题集将在可见的将来失去区分度,社区的关注点预计将进一步转向私有保留集、按配置透明化披露,以及可在线重生成、面向智能体工作流的下一代评测形态。后续将持续跟进迭代动态。

📖 相关条目

🛠️ 相关产品

🏷️ 标签HLEHumanity's Last Exam评测基准学术问答推理评测Scale AI