能力评测 2026-10-04 26 分钟阅读 进阶

BugHuntBench 横评:105 个预埋 bug 里的成本反转

当「修得最多」与「花得最少」不是同一款模型——一份判分全公开的独立实测揭示的四个结构性事实

摘要

2026 年 9 月底,独立产品经理 Pawel Huryn 公开了 BugHuntBench:在两个真实生产级仓库预埋 105 个 bug(仓库一 45 个、仓库二 60 个),让前沿编码智能体在各自命令行环境中自主找 bug 修 bug,对照隐藏答案盲评。榜单显示四个结构性事实:修得最多的 Sonnet 5.5(51.3 个)也是全场最贵的(154.03 美元);GPT-6 Sol 相对上代出现明显退步(29.3 对 43.5 个);按单个 bug 修复成本折算排名整体翻转,GPT-6.1 Sol 约每 bug 0.13 美元,仅为 Sonnet 5.5 同口径的二十几分之一;「bug-maxing」让 OpenAI 系模型额外上报大量埋入之外的问题。本文基于 GitHub 榜单全表与多家媒体报道交叉,拆解方法、数据与适用边界。

方法论:埋 bug、盲评与公开判据

BugHuntBench 的设计刻意与主流「修复已公开 issue」类基准拉开差异,规则可以概括为四条:

作者特别点出常见的翻车姿势:模型说「这里疑似有 bug」却拿不出修法,计零分。这个判定标准把「报告」与「修复」严格切开,也是后文 bug-maxing 现象的计量基础。

📋 与既有榜单的关系

SWE-bench 系列测的是「修复真实公开 issue」,Terminal-Bench 测端到端 CLI 工作流,BugHuntBench 测的是「在无提示的真实代码库里自主发现并修复预埋缺陷」——更接近维护者日常的防御性工作。本站 R-BENCH-14 曾记录 METR 的发现:SWE-bench 分数与真实维护者实测存在约 24 分落差;BugHuntBench 这类小样本、全盲评、判据公开的独立实测,是对大基准落差的一种民间校准手段。

主榜单:谁修得多

以下为 GitHub 榜单全表中的关键行(修好数 /105,均为最高推理档或标注档位;多次运行取均值):

模型 Harness 档位 运行次数 修好 /105 耗时 总成本
Sonnet 5.5 Claude Code max 3 51.3 287 分钟 $154.03
GPT-6 Astra Codex CLI max 3 45 90 分钟 $33.03
GPT-6.1 Sol Codex CLI max 3 44.3 139 分钟 $5.88
GPT-5.6 Sol Codex CLI max 2 43.5 253 分钟 $95.35
Fable 5.1 Claude Code max 1 43 73 分钟 $87.18
Opus 5.5 Claude Code max 3 41.7 67 分钟 $58.53
Muse Spark 1.3 Muse Code / Meta API max 5 32.2 86 分钟 $18.11
GPT-6 Sol Codex CLI max 3 29.3 63 分钟 $9.33
Grok 4.7 Grok Build CLI(ACP) xhigh 4 28.8 46 分钟 $22.89(包月口径)
Kimi K3 Kimi Code CLI default — 21 — —

三个直观读数:修得最多的 Sonnet 5.5(max)比次名 GPT-6 Astra 多修 6.3 个,但耗时 3 倍多、成本近 5 倍;GPT-6.1 Sol(max)以 44.3 个的成绩挤进前三,总成本却只有 5.88 美元;开源与国产模型梯队(Kimi K3 21 个、GLM-5.3 19 个、腾讯 Hy4 Preview 18 个)与闭源头部仍有约 20 个以上的差距。另需说明,个别媒体转述的总成本数字与 GitHub 榜单略有出入(如 GPT-6 Sol 有报道写 9.93 美元,榜单为 9.33 美元),本文一律以 GitHub 榜单原始数值为准。

成本反转:每个 bug 多少钱

把总成本除以修好数(按榜单数值折算),排名出现整体翻转:

模型 + 档位 修好 /105 总成本 折算单 bug 成本 相对倍数
GPT-6.1 Sol(xhigh) 42.7 $4.35 约 $0.10 1 倍(基准)
GPT-5.6 Luna(max) 31.3 $3.15 约 $0.10 1 倍
GPT-6.1 Sol(max) 44.3 $5.88 约 $0.13 1.3 倍
GPT-6 Sol(max) 29.3 $9.33 约 $0.32 3.2 倍
GPT-6 Astra(max) 45 $33.03 约 $0.73 7.3 倍
Muse Spark 1.3(max) 32.2 $18.11 约 $0.56 5.6 倍
Opus 5.5(max) 41.7 $58.53 约 $1.40 14 倍
Fable 5.1(max) 43 $87.18 约 $2.03 20 倍
GPT-5.6 Sol(max) 43.5 $95.35 约 $2.19 22 倍
Sonnet 5.5(max) 51.3 $154.03 约 $3.00 30 倍

注意这些折算值是本文基于榜单公开数值的推算,作者本人未发布单 bug 成本口径;媒体报出的倍数(如「约六倍差」)对应的是不同配对组合,读数时应对齐比较对象。但结构性结论不受口径影响:单 bug 成本的首尾差在二十倍以上,而且「单位成本最优」与「修复数登顶」不是同一款模型。对预算敏感的团队,这份数据的价值可能高于任何官方分数。

代际退步与 bug-maxing

同门代际对照:GPT-6 Sol 对 GPT-5.6 Sol

本轮最受关注的一组对照是 OpenAI 自家两代中端模型:GPT-5.6 Sol(max)修好 43.5 个,新一代 GPT-6 Sol(max)只修好 29.3 个,少了 14.2 个。作者的评语很直白:看起来是一次大退步。但同期 GPT-6 Sol 只跑了 63 分钟,上一代同档跑了 253 分钟,总成本也从 95.35 美元降到 9.33 美元——速度与成本的收益抵消了部分质量损失。这组数据提醒我们:「新一代」不是一个单维指标,厂商完全可能在代际之间重新分配质量、速度与成本三个旋钮。

bug-maxing:额外发现的价值与噪声

榜单专设「额外发现」列,记录模型上报的埋入之外的问题:GPT-6 Astra(max)报了 55 条,GPT-6.1 Sol(max)报了 65.3 条,GPT-6 Sol 报了 41.3 条。这些不全是幻觉,确实包含真实问题,只是不在预埋的 105 个之内。作者给这种行为起了名字——bug-maxing,并提醒 OpenAI 系模型尤其爱多报。对使用者的启示很直接:AI 交回来的问题清单要先核实再当真,别被画蛇添足的发现带偏节奏;而在代码审查场景里,高额外发现率反而可能是加分项。

档位滑轨:推理档位的价格弹性

作者在帖子线程里补测了 GPT-6 Astra 的四档推理档位,形成一条清晰的价格弹性曲线:

档位 修好 /105 总成本 耗时
max 45 $33.03 90 分钟
high 35 $20.60 40 分钟
medium 34 $15.78 28 分钟
low 27 $11.69 32 分钟

读法有三层:从 high 到 medium 几乎不掉分(35 对 34),多花的近 5 美元买到的增量很小;从 max 到 medium 掉 11 个 bug、省一半成本;而 low 档的 27 个已经贴着 GPT-6 Sol(max)的 29.3 个。便宜档与旗舰档之间是一条连续滑轨,选型要做的只是把每单活放到滑轨上合适的那一格——批量小修用便宜档,硬骨头再上旗舰,这笔账值得每个团队自己算。

💡 给选型者的三句话

其一,分数与账单要一起看:只盯 45 对 29.3 的落差容易忽略单 bug 成本 20 倍以上的分野;其二,档位是隐藏的价格旋钮:同一模型高低档之间能差出一款竞品;其三,榜单之外还有半个成绩单:额外发现率、耗时与运行次数方差,都应进入采购评估清单。

局限与适用边界

核心发现

参考来源

  1. Pawel Huryn — Bug Hunt Bench GitHub 仓库与实时榜单(github.com/phuryn/bug-hunt-bench,2026.10.04 直读)
  2. AGI Hunt — Bug Hunt Bench: GPT-6 Astra fixes 45 of 105 planted bugs(2026.10 转述报道)
  3. 头条「AI 公园」— AI 写代码 5 款横评,最便宜那款反而最划算(2026.10.02,转述作者 X 帖)
  4. Preuve / Test Your Idea — AI Coding Models Statistics 2026: The Real Cost per Task(AA Coding Agent Index v1.5 成本对照,2026.10.01 快照)
  5. 龙虾智能体研究院 — R-BENCH-14《编码智能体「评测与现实」鸿沟横评》(METR 落差对照)