SWE-bench Pro(企业级软件工程基准)
| 分类 | 📊 评测基准 |
| 阅读时间 | ⏱️ 16 分钟 |
| 更新时间 | 📅 2026-10-02 |
| 条目编号 | ENC-BENCH-18-swe-bench-pro |
关键要点 ✦
- 数据集三分设计对抗污染:公开集 731 题来自 11 个强著佐权许可证开源仓库并在 Hugging Face 公开,保留集 858 题来自 12 个结构镜像仓库不对外发布,商业集 276 题来自 18 家初创企业的专有代码库——后两者无法被爬入训练语料(见 arXiv:2509.16941)
- 任务难度对标真实工程:排除仅需修改 1 至 10 行的简单问题,参考解平均涉及 4.1 个文件、107.4 行代码,全部任务至少修改 10 行,逾百项任务需改超 100 行,人类工程师需数小时到数天完成
- 发布即显著落差:统一 SWE-Agent 脚手架下,GPT-5 在公开集 Pass@1 为 23.3%、Claude Opus 4.1 为 22.7%;商业集进一步降至 14.9% 与 17.8%——而同期模型在 SWE-bench Verified 上普遍报告超过 70%
- 三阶段人机协同验证保证可解性:人工构建 Docker 环境、人工增补问题描述与需求简报、人工核验测试相关性与不稳定性
- 2026 年 3 月,OpenAI Frontier Evals 团队指出 SWE-bench Verified「实质上已饱和且高度污染」,公开停止使用并建议行业转向 SWE-bench Pro;此后该基准被多家头部实验室用于追踪编程智能体能力
- 主要指标为 Pass@1:提交补丁须同时通过 fail-to-pass 新测试且不破坏既有 pass-to-pass 测试,未解决实例由 GPT-5 充当评判对失败轨迹做错误模式聚类
从 SWE-bench 到 SWE-bench Pro:饱和与污染之困
SWE-bench 由普林斯顿大学研究者在 2023 年 10 月发布,以 2,294 道真实 GitHub 问题确立了「解决真实仓库 issue」这一编程智能体评测范式;2024 年 8 月 OpenAI 发布经人工筛选的 500 题子集 SWE-bench Verified,成为厂商报告中最常引用的版本。到 2025 年年中,头部模型在 Verified 上的报告分数已超过 80%,同时公开仓库测试用例进入训练语料的污染问题愈发难以排除。
Scale AI 在论文中归纳了旧基准的四项局限:数据污染、任务多样性不足(如原版 SWE-bench 仅含 Python)、问题过度简化(Verified 中 161 题仅需一到两行修改)、评测环境不隔离导致的可复现性问题。SWE-bench Pro 针对每一项给出了工程化对策。
三分数据集:用许可证与私有库对抗污染
公开集 731 题全部取自采用强著佐权许可证(如 GPL 类)的 11 个仓库——这类许可证要求衍生作品开源,显著降低其代码被广泛收入预训练语料的概率。保留集 858 题来自与公开集结构镜像但不同的 12 个仓库,不进入公开榜单,用于未来的过拟合检查。商业集 276 题来自与 Scale 签有正式合作协议的 18 家初创企业专有代码库,无法公开获取但报告评测结果。
仓库选择覆盖消费级应用、B2B 服务与开发者工具三类场景,语言横跨 Python、JavaScript、TypeScript 与 Go;每个仓库贡献 50 至 100 个实例,避免对单一项目的过拟合。评测环境为容器化 Docker 镜像,内建 Python 虚拟环境、Node.js 与 Go 模块等依赖,评测脚本基于 SWE-Agent 框架,开源模型经 vLLM 在 8 张 H100 上托管,交互上限 200 轮。
任务设计与评测流程
任务构造走四阶段流水线:选取仓库、由专业工程师构建可复现环境、从连续提交对中收割「修复缺陷或新增功能且测试呈现 fail-to-pass 迁移」的问题、由人工把非结构化的提交与 issue 元数据增补为问题描述加需求简报。三处人机协同检查点分别确保环境可运行、描述可理解、测试相关且不抖动。
判定标准保持严格:一次端到端尝试(Pass@1)中,补丁必须让原本失败的新测试通过,且全部既有 pass-to-pass 测试不回退。对未解决实例,用 GPT-5 作为评判对失败轨迹做错误模式聚类,形成对不同模型行为特征的刻画——如部分模型存在上下文溢出、无限读文件等典型模式。
发布基线与榜单演进
2025 年 9 月发布时,GPT-5 以 23.3% 的公开集 Pass@1 位居榜首,Claude Opus 4.1 为 22.7%;商业集上两者分别降至 14.9% 与 17.8%。作为对照,同一批模型在 SWE-bench Verified 上的报告分数普遍超过 70%——这一落差成为「旧基准高估真实工程能力」的直观证据。
此后公开榜单分数逐步爬升:据公开榜单与媒体报道,2025 年 10 月 Claude Sonnet 4.5 在公开集超过 40%;2026 年上半年多家头部模型报告超过 55%。最新分数以 Scale AI 官方榜单为准,本站不单独认定任何时点的排名。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
基准危机背景下的角色与局限
SWE-bench Pro 的行业意义在 2026 年被进一步放大:3 月,OpenAI Frontier Evals 团队指出 SWE-bench Verified「实质上已饱和且高度污染」,报告其近六成问题存在测试缺陷,随即停止使用并建议行业转向 SWE-bench Pro。同期,加州大学伯克利分校 Sky 实验室发布的 Terminator-1 智能体在多项流行基准上得高分、实际解决数为零的事件,也加深了业界对评测环境不隔离问题的警觉。
局限方面:其一,商业集与保留集不公开,社区无法独立复核;其二,强著佐权许可证的选样策略缩小了仓库类型覆盖面;其三, Pass@1 单一指标难以反映真实工程中的多轮协作与验证流程;其四,随分数持续爬升,饱和压力终将再次出现,基准迭代是持续过程。相关议题可参见本站 Terminal-bench、MLE-bench 等词条对同类方法论的讨论。
🎯 应用场景
✅ 最佳实践
- 报告分数时注明数据子集(公开、商业)与脚手架配置,跨基准的分数不可直接互换比较
- 以 Pass@1 与严格的双测试判据为准,避免用放宽环境的自定义配置制造虚高
- 关注失败模式分布而不只看总分:错误方案、语法错误、上下文溢出等模式指向不同的改进方向
- 把基准结果与真实仓库的 A/B 验证结合,基准分数是参考信号而非工程承诺
- 跟进 Scale AI 官方榜单与论文修订,基准本身仍在迭代中
🔮 未来展望
随着 OpenAI 弃用 SWE-bench Verified 并公开呼吁转向,抗污染、企业级、长时程已成为编程基准演进的明确方向。SWE-bench Pro 之后,行业可能看到更多私有评测集与持续更新的「活基准」形态,以及针对评测环境隔离的标准化。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。