能力评测 2026-09-19 20 分钟阅读 进阶

AA Coding Agent Index 横评:前三名咬死在 0.6 分之内意味着什么

三基准等权合成、15 组「harness×模型」配对的全景数据,与编码智能体选型该看的三张表

摘要

Artificial Analysis 的 Coding Agent Index 是目前少数把「Agent harness + 宿主模型 + 执行配置」作为整体被测对象的合成榜单:以 DeepSWE v1.1、Terminal-Bench 4.0、SWE-Atlas-QnA 三个基准等权合成,2026 年 9 月中旬的快照显示 Claude Code(Fable 5.1 max)62.2 分居首,Devin Fusion CLI 61.7 分、Codex(GPT-6 Astra max)61.6 分紧随,前三名差距不足 0.6 分。本文拆解其评测机制与 15 组配对的全景数据,重点分析两个容易被总分掩盖的现象:同一模型换 harness 的分数漂移,与单项基准上的严重背离——以及成本、时长、token 三维数据给出的选型修正。

榜单机制:被测对象是「配对」而非「模型」

大多数模型榜单回答的问题是「哪个模型更强」,AA Coding Agent Index 回答的则是另一个问题:哪套 Agent 系统(harness + 模型 + 执行配置)在真实软件工程任务上交付得更好。这个差别决定了它的价值,也决定了读它的方式。

机制上有三个要点。其一,合成结构:Index 由三个基准等权平均构成——DeepSWE v1.1(Datacurve 出品,113 道软件工程任务)、Terminal-Bench 4.0(Laude Institute 出品,66 道智能体终端任务)、SWE-Atlas-QnA(Scale AI 出品,124 道技术问答任务);每项基准分数为逐任务三次尝试的 pass@1 均值。其二,被测单元:榜单每一行是一个「配对」——例如「Claude Code harness + Fable 5.1(max 推理档,开启 fallback)」与「Codex harness + GPT-6 Astra(max)」是两个独立条目,同一模型进入不同 harness 会形成多行。其三,配套数据:每行同时公布单任务平均 API 成本、执行时长与 token 用量,这让榜单不只是排名表,还是一张成本性能全景图。

⚙️ 口径提示

榜单快照捕获于 2026 年 9 月 18 日;镜像方 BenchLM 标注的索引版本为 v1.1,Artificial Analysis 官方页面则显示 v1.5,版本口径存在差异,本文以官方页面的三基准构成为准。所有分数为公开榜单转载,非本站独立复测。

总榜全景:15 组配对与 0.6 分的贴身战

2026 年 9 月中旬快照的 15 行完整榜单如下(分数为 Index 合成分,满分 100):

排名 Agent 配对 所属方 Index
1Claude Code - Fable 5.1 (max, with fallback)Anthropic62.2
2Devin Fusion CLI - Claude Fable 5.1 XHigh + SWE-2 MediumDevin61.7
3Codex - GPT-6 Astra (max)OpenAI61.6
4Claude Code - Opus 5 (max)Anthropic59.7
5Devin Fusion CLI - GPT-6 Astra XHigh + SWE-2 MediumDevin58.9
6Codex - GPT-5.6 Sol (max)OpenAI54.6
7Muse Code - Muse Spark 1.3 (max)Meta54.3
8Opencode - GLM-5.3 (max)Opencode53.6
9Kimi Code CLI - Kimi K3Moonshot AI51.9
10Muse Code - Muse Spark 1.3 (xhigh)Meta48.3
11Grok Build - Grok 4.6 (xhigh)xAI47.0
12Claude Code - Qwen3.8 MaxAnthropic43.3
13Codex - DeepSeek V4 Pro 0813 (max)OpenAI43.1
14Antigravity SDK - Gemini 3.8 Flash (high)Google41.9
15Codex - DeepSeek V4 Flash 0731 (max)OpenAI38.7

三个结构性观察。首先,头部饱和:前三名在 0.6 分之内,第四至第五名与前三名的差距(约 2 分)也远小于中段的分差梯度。镜像方 BenchLM 明确提示「frontier 行聚集,顶部差距解读需谨慎」——任何「榜单冠军」的叙事在这个区间都没有统计意义。其次,harness 的分量:Claude Code 和 Codex 两个 harness 各自承载了自家与第三方多款模型,Devin Fusion CLI 甚至以「双模型混编」(Fable 5.1 高档推理 + SWE-2 中档执行)拿到 61.7 分,说明执行层设计与推理档位配置已经成为和模型能力同量级的变量。再次,开源与平价阵营的位置:Opencode+GLM-5.3(53.6)与 Kimi Code CLI+Kimi K3(51.9)进入前十,与闭源头部相差约 8–10 分,差距真实存在但在收窄。

分项背离:总分之下藏着完全不同的 Agent

总榜最大的阅读陷阱是「分数相近 = 能力相近」。把头部配对的分项拆开,会看到完全不同的能力形状(下表为官方对比页公开的分项分数与单任务均值):

Agent 配对 Index DeepSWE v1.1 Terminal-Bench 4.0 SWE-Atlas-QnA 成本/任务 时长/任务 token/任务
Codex - GPT-6 Astra (max)61.668%56%62%$7.4729.4m3.3M
Codex - GPT-5.6 Sol (max)54.672%37%54%$6.5820.6m10.2M
Devin Fusion CLI - Fable 5.1 XHigh + SWE-2 Medium61.763%56%66%$7.9035.8m9.7M
Devin Fusion CLI - GPT-6 Astra XHigh + SWE-2 Medium58.967%50%59%$4.5424.7m6.1M
Codex - DeepSeek V4 Pro 0813 (max)43.157%10%62%$0.2440.3m24.2M
Codex - DeepSeek V4 Flash 0731 (max)38.754%11%51%$0.0818.3m15.4M

这张表里有三处背离尤其值得展开。

背离一:GPT-5.6 Sol 的 DeepSWE 72% 是全场最高,但终端任务仅 37%。它的总分(54.6)被 Terminal-Bench 4.0 严重拖累——这提示它在仓库级代码任务的静态推理上很强,而在需要持续与环境交互(shell、文件系统、长链条工具调用)的任务上存在明显短板。一个总分低它 7 分的配对(Codex+GPT-6 Astra,56%)在终端维度反超了 19 个百分点。若你的工作负载偏运维自动化与终端操作,「总分更低」的选项反而是对的。

背离二:DeepSeek V4 Pro 的 SWE-Atlas-QnA 拿到 62%——与 GPT-6 Astra 持平——但终端任务只有 10%。62% 对 10% 的落差是全表最极端的分项差。它说明技术问答类评估(可以靠知识推理拿分)与真刀真枪的终端操作(每一步都可能把环境搞坏)测的是两种能力;也解释了为什么总分只有 43.1 的配对依然有它的价值区间——单任务 $0.24 的成本在批处理场景几乎可以忽略。

背离三:token 效率与分数不相关。GPT-6 Astra 配对用 3.3M token 拿到 61.6 分,DeepSeek V4 Pro 用 24.2M token 拿到 43.1 分——前者约为后者七分之一的消耗换近 19 分的优势;但在另一端,Devin Fusion CLI 的 Fable 5.1 混编(9.7M token)与 GPT-6 Astra 混编(6.1M token)分差仅 2.8 分,token 差 59%。执行层的「啰嗦程度」是 harness 的属性,不是模型的属性——换 harness 比换模型更能改变你的账单结构。

成本-时间- token:第二张、第三张表

把 15 行数据按成本与时长重排,可以划出三个典型的性价比区间:

区间 代表配对 成本/任务 典型用途
前沿区 Claude Code-Fable 5.1、Devin Fusion CLI、Codex-GPT-6 Astra 约 $4.5–7.9 高难度变更、架构级重构、错误代价高的任务
中坚区 Opencode-GLM-5.3、Kimi Code CLI-K3、Muse Code-Spark 1.3 约 $1–3(榜单区间中位) 日常功能开发、批量中小任务
平价区 Codex-DeepSeek V4 Pro / Flash 约 $0.08–0.24 大规模批处理、初筛、对延迟不敏感的流水线

需要强调口径:榜单的成本是「按 token 计价的 API 单任务成本」,不含基础设施与人工监督开销,也不代表订阅制产品的实际支出。第三方实测数据提供了参照系——Octomind 用 25 道取自 2026 年真实合并 PR 的任务自测,其 Claude Code 全套花费 $81.79(23/25 解出、6.7 小时),Codex CLI 仅 $14.86(21/25、1.0 小时),差距比合成榜单显示的更大。两套数据放在一起的结论是:API 口径的「每任务成本」排序相对稳定,但绝对值会随任务分布与 harness 配置大幅波动,团队应以自身任务抽样重估,而不是直接引用榜单数字做预算。

正确读法:饱和区、自报数据与口径提示

对选型的启示

把三张表(总分、分项、成本)合起来看,编码智能体选型可以压缩成三条可操作的规则:

规则一:先分项后总分。按你的任务分布给三个基准维度分配权重,再用分项分数重排榜单。终端重负载团队看 Terminal-Bench 4.0 列,仓库级开发看 DeepSWE 列,知识型审查看 SWE-Atlas-QnA 列。

规则二:harness 是一等服务变量。同一个 GPT-6 Astra,在 Codex 里 61.6 分、在 Devin Fusion CLI 里 58.9 分;同一个 Fable 5.1,两个 harness 分差约 0.5 分但成本与 token 结构完全不同。评估时把「模型选型」与「harness 选型」当作两个独立决策。

规则三:混合梯队是默认答案。前沿区配对解决 10% 的高难任务,平价区配对消化 60% 以上的常规量——榜单第三张表(成本列)的最大价值,是让「按任务难度分配 Agent」的阶梯方案有了可计算的依据。这与本站此前对 Terminal-Bench 横评、SWE-bench Pro 的结论一致:Agent 系统的竞争已经从「单点比拼头部模型」转入「系统级配置」的比拼,评测数据的正确用法是支撑这种配置决策,而非制造冠军叙事。

核心发现

参考来源

  1. Artificial Analysis 官网 — AI Coding Agent Benchmarks & Leaderboard(Index 机制说明:三基准构成、pass@1 三次均值、2026.09 快照)
  2. Artificial Analysis — Codex vs Devin Fusion CLI: Coding Agent Comparison(分项分数、单任务成本/时长/token 公开数据页)
  3. BenchLM.ai — AA Coding Agents Leaderboard mirror(15 行完整榜单、saturation 标注与数据源说明,2026.09.18 捕获)
  4. MightyBot — Best AI Coding Agents in 2026, Ranked(2026 年 9 月编码智能体市场动态与官方 Terminal-Bench 4.0 口径对照,2026.09.18 更新)
  5. Octomind — The Best AI Coding Agents in 2026, Ranked by Actual Benchmark Data(25 道真实 PR 任务的自建基准实测:成本 $14.86–129.54 与用时对照)
  6. RankLLMs — Best LLM for Coding in 2026: Benchmark Data & Cost per Solved Task(每解出题成本口径与价格分层分析)