两份互相打架的排行榜
软件工程师 Dan Luu 发布了一篇长文,主题是三类被当作证据使用的基准:性能估算用的「纸巾数学」、AI 编码模型评测、以及冬季轮胎的对比结论。其中与智能体关系最直接的部分,是他对 DeepSWE 与 Senior SWE-Bench 的拆解——这两份榜单在工程团队的模型选型讨论里被反复引用。
他先摆出了两组彼此矛盾的读法。按 DeepSWE 的公开表格读,OpenAI 上一代的 GPT-5.5 与 Anthropic 当前的 Fable 5 表现相当;按 Senior SWE-Bench 的表格读,Anthropic 较早的 Opus 4.8 反而压过 OpenAI 当前的 GPT-5.6。同一个行业,两份榜单给出方向相反的结论,而 Luu 的判断是,这两套排名与他和其他一线工程师的实际体感都对不上。
DeepSWE:113 个任务,分歧里的活儿不像日常活儿
他对 DeepSWE 的质疑不在算术。这份基准全集是 113 个任务,每个任务跑四次,按五分制通过率计分。GPT-5.5 以 67% 领先 Opus 4.8 的 54%,两者在 34 个任务上打平,GPT-5.5 赢 57 个、输 22 个。
问题出在这 79 个分歧任务的构成上。Luu 说自己日常真正依赖编码智能体的语言是 Rust,而这份基准里只有四个任务是 Rust 写的,且他认为这四个没有一个像他处理过的真实工单。换句话说,决定两个模型胜负的那批题,与他的工作场景几乎没有交集;而他自己体感中最需要智能体的场景,恰恰没有进入这个样本。
这不等于 DeepSWE 造假,而是揭示了基准的适用边界:一份基准测的是它自己选的那类任务,一旦任务集与使用者的工作形态不匹配,榜单排序就失去了采购参考价值。
Senior SWE-Bench:把连续的质量判断变成悬崖
在 Luu 看来,Senior SWE-Bench 的问题更结构性。要让一个答案被计为「tasteful solve」,必须同时满足两个条件:通过评分细则的阈值,并且长度不超过参考解的两倍。第二条把原本连续的质量判断压缩成了一个非过即败的开关。
他举了一个具体例子:某个任务上 GLM-5.2 提交 121 行,被计为通过,而参考解是 61 行——也就是说再多写一行,结果就从通过翻成失败。另一个任务的参考解只有一行代码,按两倍上限计算,允许通过的最长答案只有三行。这类阈值并非来自对问题难度的分析,而是一个没有人论证过的公式。
对使用者的实际含义是:一份榜单上的名次,可能取决于评分脚本里某个常数的取值,而非模型解决真实问题的能力差异。他提到,自己曾就这套推理与 Aaron Levin 核对,后者曾在 Anthropic 的评测团队工作,并认同这一结论。Luu 强调这只是佐证而非证明,因为他指出的都是实验设计层面的基础问题,不需要 AI 专业知识就能判断。
只跑一次的代价
另一个被 Luu 盯上的细节是重复次数。他称每个条件在该基准上只跑一次,而据他的观察,同一个模型重复运行之间的方差,比不同模型之间的差异还大。
这一条与近期其他研究形成了呼应。IBM Research 团队在 AppWorld 上的测量显示,同一个 ReAct 智能体平均成功率 77.4%,而五次重复全部成功的任务只有 53.0%,差出 24.4 个百分点;团队把原因归到各决策步上 token 概率分布的平坦程度,甚至温度设为零也无法消除。把这两件事放在一起看,单次运行的基准分数作为选型依据的可靠性就更值得怀疑:如果同一模型自己跑两次都会换答案,一次运行得出的名次说明不了什么。
这套检查表适用于任何整洁的横扫
Luu 的批评并不针对某一家厂商。他给出的是一套通用的提问方式:这个分数覆盖多少个任务、任务集是否对你的代码库有代表性、基准跑了几次、及格线是怎么定出来的。
他顺带提到,Artificial Analysis 本月更新能力指数时,Claude Fable 5.1 在六个维度上全部领先。他没有讨论这些指数,但他的检查表同样适用——一份全面领先的成绩单,如果建立在样本过小、单次运行和硬阈值之上,那么把它反过来做同样容易。这句话点出了基准生态里一个不易被承认的事实:基准不仅测量能力,也在被选择用来产出一个想被看到的结果。
对采购与选型的实际含义
对正在挑编码模型的团队来说,这篇长文的价值在于把「看榜」替换成「看条件」。可行做法大致有几条:先确认基准任务集里有多少与自家技术栈重叠;向提供方索要重复运行的数据而非单次结果;对连续质量指标追问阈值的来源;更重要的是,用自己仓库里的历史工单做一轮小样本内部评测,而不是直接采信外部名次。
需要说明的是,Luu 的文章是基于公开基准数据与个人工程经验的分析,其结论属于方法论批评,并非对这些模型的横向实测。他也没有给出一份替代榜单。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
结语
编码智能体这一年的能力进步是真实的,但衡量进步的方式显然还没跟上。当一份榜样的分数取决于样本是否像你的活儿、阈值是否有人论证过、以及它究竟跑了一次还是五次时,真正需要的不是更响亮的排名,而是更诚实的实验设计。把基准当成证据而不是结论,是这一轮里最省钱的一条选型纪律。