榜单机制:被测对象是「配对」而非「模型」
大多数模型榜单回答的问题是「哪个模型更强」,AA Coding Agent Index 回答的则是另一个问题:哪套 Agent 系统(harness + 模型 + 执行配置)在真实软件工程任务上交付得更好。这个差别决定了它的价值,也决定了读它的方式。
机制上有三个要点。其一,合成结构:Index 由三个基准等权平均构成——DeepSWE v1.1(Datacurve 出品,113 道软件工程任务)、Terminal-Bench 4.0(Laude Institute 出品,66 道智能体终端任务)、SWE-Atlas-QnA(Scale AI 出品,124 道技术问答任务);每项基准分数为逐任务三次尝试的 pass@1 均值。其二,被测单元:榜单每一行是一个「配对」——例如「Claude Code harness + Fable 5.1(max 推理档,开启 fallback)」与「Codex harness + GPT-6 Astra(max)」是两个独立条目,同一模型进入不同 harness 会形成多行。其三,配套数据:每行同时公布单任务平均 API 成本、执行时长与 token 用量,这让榜单不只是排名表,还是一张成本性能全景图。
榜单快照捕获于 2026 年 9 月 18 日;镜像方 BenchLM 标注的索引版本为 v1.1,Artificial Analysis 官方页面则显示 v1.5,版本口径存在差异,本文以官方页面的三基准构成为准。所有分数为公开榜单转载,非本站独立复测。
总榜全景:15 组配对与 0.6 分的贴身战
2026 年 9 月中旬快照的 15 行完整榜单如下(分数为 Index 合成分,满分 100):
| 排名 | Agent 配对 | 所属方 | Index |
|---|---|---|---|
| 1 | Claude Code - Fable 5.1 (max, with fallback) | Anthropic | 62.2 |
| 2 | Devin Fusion CLI - Claude Fable 5.1 XHigh + SWE-2 Medium | Devin | 61.7 |
| 3 | Codex - GPT-6 Astra (max) | OpenAI | 61.6 |
| 4 | Claude Code - Opus 5 (max) | Anthropic | 59.7 |
| 5 | Devin Fusion CLI - GPT-6 Astra XHigh + SWE-2 Medium | Devin | 58.9 |
| 6 | Codex - GPT-5.6 Sol (max) | OpenAI | 54.6 |
| 7 | Muse Code - Muse Spark 1.3 (max) | Meta | 54.3 |
| 8 | Opencode - GLM-5.3 (max) | Opencode | 53.6 |
| 9 | Kimi Code CLI - Kimi K3 | Moonshot AI | 51.9 |
| 10 | Muse Code - Muse Spark 1.3 (xhigh) | Meta | 48.3 |
| 11 | Grok Build - Grok 4.6 (xhigh) | xAI | 47.0 |
| 12 | Claude Code - Qwen3.8 Max | Anthropic | 43.3 |
| 13 | Codex - DeepSeek V4 Pro 0813 (max) | OpenAI | 43.1 |
| 14 | Antigravity SDK - Gemini 3.8 Flash (high) | 41.9 | |
| 15 | Codex - DeepSeek V4 Flash 0731 (max) | OpenAI | 38.7 |
三个结构性观察。首先,头部饱和:前三名在 0.6 分之内,第四至第五名与前三名的差距(约 2 分)也远小于中段的分差梯度。镜像方 BenchLM 明确提示「frontier 行聚集,顶部差距解读需谨慎」——任何「榜单冠军」的叙事在这个区间都没有统计意义。其次,harness 的分量:Claude Code 和 Codex 两个 harness 各自承载了自家与第三方多款模型,Devin Fusion CLI 甚至以「双模型混编」(Fable 5.1 高档推理 + SWE-2 中档执行)拿到 61.7 分,说明执行层设计与推理档位配置已经成为和模型能力同量级的变量。再次,开源与平价阵营的位置:Opencode+GLM-5.3(53.6)与 Kimi Code CLI+Kimi K3(51.9)进入前十,与闭源头部相差约 8–10 分,差距真实存在但在收窄。
分项背离:总分之下藏着完全不同的 Agent
总榜最大的阅读陷阱是「分数相近 = 能力相近」。把头部配对的分项拆开,会看到完全不同的能力形状(下表为官方对比页公开的分项分数与单任务均值):
| Agent 配对 | Index | DeepSWE v1.1 | Terminal-Bench 4.0 | SWE-Atlas-QnA | 成本/任务 | 时长/任务 | token/任务 |
|---|---|---|---|---|---|---|---|
| Codex - GPT-6 Astra (max) | 61.6 | 68% | 56% | 62% | $7.47 | 29.4m | 3.3M |
| Codex - GPT-5.6 Sol (max) | 54.6 | 72% | 37% | 54% | $6.58 | 20.6m | 10.2M |
| Devin Fusion CLI - Fable 5.1 XHigh + SWE-2 Medium | 61.7 | 63% | 56% | 66% | $7.90 | 35.8m | 9.7M |
| Devin Fusion CLI - GPT-6 Astra XHigh + SWE-2 Medium | 58.9 | 67% | 50% | 59% | $4.54 | 24.7m | 6.1M |
| Codex - DeepSeek V4 Pro 0813 (max) | 43.1 | 57% | 10% | 62% | $0.24 | 40.3m | 24.2M |
| Codex - DeepSeek V4 Flash 0731 (max) | 38.7 | 54% | 11% | 51% | $0.08 | 18.3m | 15.4M |
这张表里有三处背离尤其值得展开。
背离一:GPT-5.6 Sol 的 DeepSWE 72% 是全场最高,但终端任务仅 37%。它的总分(54.6)被 Terminal-Bench 4.0 严重拖累——这提示它在仓库级代码任务的静态推理上很强,而在需要持续与环境交互(shell、文件系统、长链条工具调用)的任务上存在明显短板。一个总分低它 7 分的配对(Codex+GPT-6 Astra,56%)在终端维度反超了 19 个百分点。若你的工作负载偏运维自动化与终端操作,「总分更低」的选项反而是对的。
背离二:DeepSeek V4 Pro 的 SWE-Atlas-QnA 拿到 62%——与 GPT-6 Astra 持平——但终端任务只有 10%。62% 对 10% 的落差是全表最极端的分项差。它说明技术问答类评估(可以靠知识推理拿分)与真刀真枪的终端操作(每一步都可能把环境搞坏)测的是两种能力;也解释了为什么总分只有 43.1 的配对依然有它的价值区间——单任务 $0.24 的成本在批处理场景几乎可以忽略。
背离三:token 效率与分数不相关。GPT-6 Astra 配对用 3.3M token 拿到 61.6 分,DeepSeek V4 Pro 用 24.2M token 拿到 43.1 分——前者约为后者七分之一的消耗换近 19 分的优势;但在另一端,Devin Fusion CLI 的 Fable 5.1 混编(9.7M token)与 GPT-6 Astra 混编(6.1M token)分差仅 2.8 分,token 差 59%。执行层的「啰嗦程度」是 harness 的属性,不是模型的属性——换 harness 比换模型更能改变你的账单结构。
成本-时间- token:第二张、第三张表
把 15 行数据按成本与时长重排,可以划出三个典型的性价比区间:
| 区间 | 代表配对 | 成本/任务 | 典型用途 |
|---|---|---|---|
| 前沿区 | Claude Code-Fable 5.1、Devin Fusion CLI、Codex-GPT-6 Astra | 约 $4.5–7.9 | 高难度变更、架构级重构、错误代价高的任务 |
| 中坚区 | Opencode-GLM-5.3、Kimi Code CLI-K3、Muse Code-Spark 1.3 | 约 $1–3(榜单区间中位) | 日常功能开发、批量中小任务 |
| 平价区 | Codex-DeepSeek V4 Pro / Flash | 约 $0.08–0.24 | 大规模批处理、初筛、对延迟不敏感的流水线 |
需要强调口径:榜单的成本是「按 token 计价的 API 单任务成本」,不含基础设施与人工监督开销,也不代表订阅制产品的实际支出。第三方实测数据提供了参照系——Octomind 用 25 道取自 2026 年真实合并 PR 的任务自测,其 Claude Code 全套花费 $81.79(23/25 解出、6.7 小时),Codex CLI 仅 $14.86(21/25、1.0 小时),差距比合成榜单显示的更大。两套数据放在一起的结论是:API 口径的「每任务成本」排序相对稳定,但绝对值会随任务分布与 harness 配置大幅波动,团队应以自身任务抽样重估,而不是直接引用榜单数字做预算。
正确读法:饱和区、自报数据与口径提示
- 饱和区不排座次:前三名 0.6 分之内的差距,低于三次尝试均值本身就是噪声的量级。把「榜首易主」当新闻可以,当选型依据不行。
- 厂商自营行是自报数据:镜像方明确标注「provider self-report 是可展示的证据,而非独立运行」——Claude Code 与 Codex 的自营行成绩由厂商自报,Devin 等第三方配对为榜单方运行,两类数据源的可信度结构不同,横向比较需留一分保留。
- 等权合成的价值假设:三基准等权意味着「终端操作、仓库任务、技术问答」被默认为同等重要。你的团队若 90% 的工作是终端自动化,等权总分就不再是你的目标函数——请直接读分项表。
- 时效与版本:分数为 2026 年 9 月 18 日快照,模型与 harness 都在快速迭代(如 GPT-6 Astra 9 月初才成为 Codex 默认模型);Index 版本在 v1.1 与 v1.5 之间存在口径差异,跨期对比需核对版本。
对选型的启示
把三张表(总分、分项、成本)合起来看,编码智能体选型可以压缩成三条可操作的规则:
规则一:先分项后总分。按你的任务分布给三个基准维度分配权重,再用分项分数重排榜单。终端重负载团队看 Terminal-Bench 4.0 列,仓库级开发看 DeepSWE 列,知识型审查看 SWE-Atlas-QnA 列。
规则二:harness 是一等服务变量。同一个 GPT-6 Astra,在 Codex 里 61.6 分、在 Devin Fusion CLI 里 58.9 分;同一个 Fable 5.1,两个 harness 分差约 0.5 分但成本与 token 结构完全不同。评估时把「模型选型」与「harness 选型」当作两个独立决策。
规则三:混合梯队是默认答案。前沿区配对解决 10% 的高难任务,平价区配对消化 60% 以上的常规量——榜单第三张表(成本列)的最大价值,是让「按任务难度分配 Agent」的阶梯方案有了可计算的依据。这与本站此前对 Terminal-Bench 横评、SWE-bench Pro 的结论一致:Agent 系统的竞争已经从「单点比拼头部模型」转入「系统级配置」的比拼,评测数据的正确用法是支撑这种配置决策,而非制造冠军叙事。