📊 评测基准

SWE-bench Pro(企业级软件工程基准)

别名:SWE-Bench ProSWE-bench ProScale AI 软件工程基准长时程编程智能体基准
分类📊 评测基准
阅读时间⏱️ 16 分钟
更新时间📅 2026-10-02
条目编号ENC-BENCH-18-swe-bench-pro
SWE-bench Pro 是 Scale AI 于 2025 年 9 月 21 日发布的长时程企业级软件工程基准,含 1,865 道来自 41 个活跃维护代码库的真实问题,以三分数据集的设计对抗训练数据污染,用于评测编程智能体解决多文件复杂任务的能力。

关键要点 ✦

从 SWE-bench 到 SWE-bench Pro:饱和与污染之困

SWE-bench 由普林斯顿大学研究者在 2023 年 10 月发布,以 2,294 道真实 GitHub 问题确立了「解决真实仓库 issue」这一编程智能体评测范式;2024 年 8 月 OpenAI 发布经人工筛选的 500 题子集 SWE-bench Verified,成为厂商报告中最常引用的版本。到 2025 年年中,头部模型在 Verified 上的报告分数已超过 80%,同时公开仓库测试用例进入训练语料的污染问题愈发难以排除。

Scale AI 在论文中归纳了旧基准的四项局限:数据污染、任务多样性不足(如原版 SWE-bench 仅含 Python)、问题过度简化(Verified 中 161 题仅需一到两行修改)、评测环境不隔离导致的可复现性问题。SWE-bench Pro 针对每一项给出了工程化对策。

三分数据集:用许可证与私有库对抗污染

公开集 731 题全部取自采用强著佐权许可证(如 GPL 类)的 11 个仓库——这类许可证要求衍生作品开源,显著降低其代码被广泛收入预训练语料的概率。保留集 858 题来自与公开集结构镜像但不同的 12 个仓库,不进入公开榜单,用于未来的过拟合检查。商业集 276 题来自与 Scale 签有正式合作协议的 18 家初创企业专有代码库,无法公开获取但报告评测结果。

仓库选择覆盖消费级应用、B2B 服务与开发者工具三类场景,语言横跨 Python、JavaScript、TypeScript 与 Go;每个仓库贡献 50 至 100 个实例,避免对单一项目的过拟合。评测环境为容器化 Docker 镜像,内建 Python 虚拟环境、Node.js 与 Go 模块等依赖,评测脚本基于 SWE-Agent 框架,开源模型经 vLLM 在 8 张 H100 上托管,交互上限 200 轮。

任务设计与评测流程

任务构造走四阶段流水线:选取仓库、由专业工程师构建可复现环境、从连续提交对中收割「修复缺陷或新增功能且测试呈现 fail-to-pass 迁移」的问题、由人工把非结构化的提交与 issue 元数据增补为问题描述加需求简报。三处人机协同检查点分别确保环境可运行、描述可理解、测试相关且不抖动。

判定标准保持严格:一次端到端尝试(Pass@1)中,补丁必须让原本失败的新测试通过,且全部既有 pass-to-pass 测试不回退。对未解决实例,用 GPT-5 作为评判对失败轨迹做错误模式聚类,形成对不同模型行为特征的刻画——如部分模型存在上下文溢出、无限读文件等典型模式。

发布基线与榜单演进

2025 年 9 月发布时,GPT-5 以 23.3% 的公开集 Pass@1 位居榜首,Claude Opus 4.1 为 22.7%;商业集上两者分别降至 14.9% 与 17.8%。作为对照,同一批模型在 SWE-bench Verified 上的报告分数普遍超过 70%——这一落差成为「旧基准高估真实工程能力」的直观证据。

此后公开榜单分数逐步爬升:据公开榜单与媒体报道,2025 年 10 月 Claude Sonnet 4.5 在公开集超过 40%;2026 年上半年多家头部模型报告超过 55%。最新分数以 Scale AI 官方榜单为准,本站不单独认定任何时点的排名。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

基准危机背景下的角色与局限

SWE-bench Pro 的行业意义在 2026 年被进一步放大:3 月,OpenAI Frontier Evals 团队指出 SWE-bench Verified「实质上已饱和且高度污染」,报告其近六成问题存在测试缺陷,随即停止使用并建议行业转向 SWE-bench Pro。同期,加州大学伯克利分校 Sky 实验室发布的 Terminator-1 智能体在多项流行基准上得高分、实际解决数为零的事件,也加深了业界对评测环境不隔离问题的警觉。

局限方面:其一,商业集与保留集不公开,社区无法独立复核;其二,强著佐权许可证的选样策略缩小了仓库类型覆盖面;其三, Pass@1 单一指标难以反映真实工程中的多轮协作与验证流程;其四,随分数持续爬升,饱和压力终将再次出现,基准迭代是持续过程。相关议题可参见本站 Terminal-bench、MLE-bench 等词条对同类方法论的讨论。

🎯 应用场景

前沿模型能力追踪
以公开集 Pass@1 追踪编程智能体在长时程企业级任务上的真实进展,避免旧基准的虚高信号。
训练数据污染检测
保留集与商业集作为不可爬取的对照,用于检验模型是否「背题」而非真正解题。
智能体脚手架对比
统一脚手架与容器化环境下的失败轨迹聚类,为工具调用策略、上下文管理方案提供可比依据。
企业采购参考
商业集贴近私有代码库场景,其结果对评估模型在自有工程资产上的表现更具参考价值。

✅ 最佳实践

  • 报告分数时注明数据子集(公开、商业)与脚手架配置,跨基准的分数不可直接互换比较
  • 以 Pass@1 与严格的双测试判据为准,避免用放宽环境的自定义配置制造虚高
  • 关注失败模式分布而不只看总分:错误方案、语法错误、上下文溢出等模式指向不同的改进方向
  • 把基准结果与真实仓库的 A/B 验证结合,基准分数是参考信号而非工程承诺
  • 跟进 Scale AI 官方榜单与论文修订,基准本身仍在迭代中

🔮 未来展望

随着 OpenAI 弃用 SWE-bench Verified 并公开呼吁转向,抗污染、企业级、长时程已成为编程基准演进的明确方向。SWE-bench Pro 之后,行业可能看到更多私有评测集与持续更新的「活基准」形态,以及针对评测环境隔离的标准化。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

📖 相关条目

🛠️ 相关产品

🏷️ 标签SWE-bench Pro评测基准编程智能体软件工程数据污染长时程任务