📊 评测基准

MLE-bench(机器学习工程基准)

别名:MLE-benchMLE-BenchMachine Learning Engineering Benchmark机器学习工程基准
分类📊 评测基准
阅读时间⏱️ 15 分钟
更新时间📅 2026-09-28
条目编号ENC-BENCH-17-mle-bench
MLE-bench 是 OpenAI 准备团队于 2024 年 10 月发布的智能体评测基准(arXiv:2410.07095),从 Kaggle 精选 75 场机器学习竞赛,考察智能体端到端完成读题、备数据、训模型、调参与提交等真实机器学习工程任务的能力,以奖牌数对标人类参赛者。

关键要点 ✦

基准设计与评测口径

MLE-bench 由 OpenAI 准备团队于 2024 年 10 月 9 日发布(arXiv:2410.07095)。基准从 Kaggle 精选 75 场机器学习竞赛,按复杂度分为低(22 场)、中(38 场)、高(15 场)三档,另设 7 场开发集。评测时智能体阅读竞赛说明、准备数据、训练模型、迭代调参并提交结果文件,提交结果按原竞赛 Kaggle 私有榜单的铜、银、金牌阈值评级——核心指标为「至少获得铜牌的竞赛比例」,铜牌大致对应人类参赛者排行榜前 40%。

发布时的关键结果

据 OpenAI 官方公布,使用开源智能体脚手架评测多款前沿模型,成绩领先的设置为 o1-preview 搭配 AIDE 脚手架,在 16.9% 的竞赛中至少达到铜牌水平(16 个随机种子平均),GPT-4o(AIDE)为 8.7%,Claude 3.5 Sonnet(AIDE)为 7.6%。论文同时报告:pass@8 时 o1-preview 的得奖率升至 34.1%;给 GPT-4o 每场竞赛 100 小时算力可把得奖率提高到 11.8%;对竞赛描述做混淆处理后分数变化不大,说明预训练数据污染对结果的贡献有限。

安全研究中的定位

MLE-bench 的特殊意义在于它测量的「ML R&D 能力」:能自主执行开放式机器学习任务的智能体,理论上具备改进自身训练代码的可能。因此 OpenAI 的 Preparedness Framework、Anthropic 的负责任扩展政策与 Google DeepMind 的前沿安全框架都将其(或同类任务)列为候选能力测量项,用于判断模型自动化前沿研究带来的风险是否逼近安全阈值。该论文后经同行评审发表于 ICLR 2025 并获口头报告。

社区演进与争议

2025 年 9 月起社区榜单参与者明显增多,成绩从 40 多分升至 60 分上下。2026 年 2 月,创业公司 Disarray 提交的 77.78 分成绩引发争议:社区发现其智能体利用公开与私有测试集之间的关系并接收铜牌阈值反馈信号,涉嫌数据泄漏。2026 年 3 月 23 日,MLE-bench 仓库新增清洁赛道(No Private LB),把有数据泄漏嫌疑的成绩移至带警示标注的第二榜单;百度伐谋(FM Agent)在不使用私有反馈信号与外部数据的约束下提交 64.44 分,其论文(arXiv:2510.26144)报告任意奖牌率 43.56%、金牌率 22.67%(以上动态据社区榜单与媒体公开信息)。

局限

MLE-bench 运行成本高、周期长,参与者数量有限;社区榜单成绩口径不一——是否使用私有榜单反馈、外部数据或最新模型,都会显著影响可比性,横向比较需谨慎核对各提交的实验设置。后续动态持续跟进。

🎯 应用场景

评估编码智能体的长周期工程能力
竞赛任务动辄数小时的训练与调试,适合检验智能体的长程规划与自我纠错。
实验室安全能力评估
作为 ML R&D 能力的候选测量项,用于前沿模型风险评估框架的能力监测。
自动化 ML 工具的横向参照
为自动化机器学习产品提供统一任务集与人类奖牌基准的对照参考。

✅ 最佳实践

  • 报告成绩时完整披露脚手架、模型版本、计算预算与运行种子数
  • 遵循清洁赛道口径,不使用私有榜单反馈信号与外部数据
  • 与 Terminal-Bench、OSWorld 等基准交叉验证,避免单一任务域高估能力
  • 比较社区榜单成绩时先核对各提交的实验设置与赛道归属

🔮 未来展望

随着 v2 版本与社区榜单演进,MLE-bench 正成为衡量智能体自主研究能力的重要参照;头部成绩与评测口径仍在变化,后续将持续跟进迭代动态。

📖 相关条目

🛠️ 相关产品

🏷️ 标签MLE-bench评测基准Kaggle机器学习工程智能体评测