MLE-bench(机器学习工程基准)
| 分类 | 📊 评测基准 |
| 阅读时间 | ⏱️ 15 分钟 |
| 更新时间 | 📅 2026-09-28 |
| 条目编号 | ENC-BENCH-17-mle-bench |
关键要点 ✦
- 任务构成:75 场 Kaggle 机器学习竞赛(低复杂度 22、中 38、高 15,另有 7 场开发集),覆盖训练模型、准备数据、运行实验等工程技能。
- 评测口径:按 Kaggle 私有榜单的铜、银、金牌阈值评级,核心指标是智能体至少达到铜牌水平的竞赛比例。
- 基线成绩:据 OpenAI 官方公布,o1-preview 搭配 AIDE 脚手架在 16.9% 的竞赛中达到铜牌水平,GPT-4o(AIDE)为 8.7%;pass@8 时 o1-preview 达 34.1%。
- 安全定位:被 OpenAI Preparedness Framework、Anthropic 负责任扩展政策与 Google DeepMind 前沿安全框架列为「ML R&D 能力」的候选测量项。
- 论文经同行评审发表于 ICLR 2025(口头报告),代码开源于 github.com/openai/mle-bench,社区榜单 mlebench.com 持续追踪进展。
- 2026 年动态:2 月 Disarray 公司的成绩因利用私有测试集反馈信号引发数据泄漏争议;3 月 23 日官方新增清洁赛道(No Private LB)隔离存疑成绩。
基准设计与评测口径
MLE-bench 由 OpenAI 准备团队于 2024 年 10 月 9 日发布(arXiv:2410.07095)。基准从 Kaggle 精选 75 场机器学习竞赛,按复杂度分为低(22 场)、中(38 场)、高(15 场)三档,另设 7 场开发集。评测时智能体阅读竞赛说明、准备数据、训练模型、迭代调参并提交结果文件,提交结果按原竞赛 Kaggle 私有榜单的铜、银、金牌阈值评级——核心指标为「至少获得铜牌的竞赛比例」,铜牌大致对应人类参赛者排行榜前 40%。
发布时的关键结果
据 OpenAI 官方公布,使用开源智能体脚手架评测多款前沿模型,成绩领先的设置为 o1-preview 搭配 AIDE 脚手架,在 16.9% 的竞赛中至少达到铜牌水平(16 个随机种子平均),GPT-4o(AIDE)为 8.7%,Claude 3.5 Sonnet(AIDE)为 7.6%。论文同时报告:pass@8 时 o1-preview 的得奖率升至 34.1%;给 GPT-4o 每场竞赛 100 小时算力可把得奖率提高到 11.8%;对竞赛描述做混淆处理后分数变化不大,说明预训练数据污染对结果的贡献有限。
安全研究中的定位
MLE-bench 的特殊意义在于它测量的「ML R&D 能力」:能自主执行开放式机器学习任务的智能体,理论上具备改进自身训练代码的可能。因此 OpenAI 的 Preparedness Framework、Anthropic 的负责任扩展政策与 Google DeepMind 的前沿安全框架都将其(或同类任务)列为候选能力测量项,用于判断模型自动化前沿研究带来的风险是否逼近安全阈值。该论文后经同行评审发表于 ICLR 2025 并获口头报告。
社区演进与争议
2025 年 9 月起社区榜单参与者明显增多,成绩从 40 多分升至 60 分上下。2026 年 2 月,创业公司 Disarray 提交的 77.78 分成绩引发争议:社区发现其智能体利用公开与私有测试集之间的关系并接收铜牌阈值反馈信号,涉嫌数据泄漏。2026 年 3 月 23 日,MLE-bench 仓库新增清洁赛道(No Private LB),把有数据泄漏嫌疑的成绩移至带警示标注的第二榜单;百度伐谋(FM Agent)在不使用私有反馈信号与外部数据的约束下提交 64.44 分,其论文(arXiv:2510.26144)报告任意奖牌率 43.56%、金牌率 22.67%(以上动态据社区榜单与媒体公开信息)。
局限
MLE-bench 运行成本高、周期长,参与者数量有限;社区榜单成绩口径不一——是否使用私有榜单反馈、外部数据或最新模型,都会显著影响可比性,横向比较需谨慎核对各提交的实验设置。后续动态持续跟进。
🎯 应用场景
✅ 最佳实践
- 报告成绩时完整披露脚手架、模型版本、计算预算与运行种子数
- 遵循清洁赛道口径,不使用私有榜单反馈信号与外部数据
- 与 Terminal-Bench、OSWorld 等基准交叉验证,避免单一任务域高估能力
- 比较社区榜单成绩时先核对各提交的实验设置与赛道归属
🔮 未来展望
随着 v2 版本与社区榜单演进,MLE-bench 正成为衡量智能体自主研究能力的重要参照;头部成绩与评测口径仍在变化,后续将持续跟进迭代动态。