能力评测 2026-09-29 22 分钟阅读 进阶

9·22 发布潮编码智能体横评:Terminal-Bench 拉开 28.8 分,DeepSWE 却贴到 3.2 分

Opus 5.5 与 GPT-6 Sol/Luna 同日发布的四天之后 — 四组基准给出四幅几乎不重叠的能力地图,怎么读才是对的

摘要

2026 年 9 月 22 日,Anthropic 发布 Claude Opus 5.5 并当天设为 Claude Code 默认模型,OpenAI 同日在 Codex 上线 GPT-6 Sol 与 GPT-6 Luna——一个月内叠加 Grok 4.7(9/21)、DeepSeek V4.1 Flash(9/10)与复合模型 Pareto(9/17),编码智能体的牌桌在两周内换了三圈。本文汇总发布潮后的公开量化数据:Terminal-Bench 4.0 上头部与尾部拉开 28.8 个百分点,DeepSWE v1.1 上四款模型却挤在 3.2 个百分点内;AutomationBench 的分数出自 Zapier 执行的第三方口径;AA Coding Agent Index 给出 66/62/57 的系统级排序;octobench 的 25 个真实 PR 实测则显示套件总成本差距可达 8.7 倍。核心结论:这轮发布潮再次证明「基准分化结构」比「榜单名次」更有信息量,执行 harness 与口径归属决定你看到的每一分。

两周三圈牌:9 月发布潮时间线

把 9 月的编码智能体相关发布按时间排开,密度相当罕见:

日期(2026 年) 发布 关键参数与公开口径
9 月 10 日 DeepSeek V4.1 Flash 552B 参数 MoE、1M 词元上下文、MIT 许可权重;错峰 $0.15/$0.60、高峰 $0.30/$1.20 每百万词元;自报 Terminal-Bench 4.0 为 31.2%(自家 harness,未上官方榜)
9 月 17 日 Unbiased Pareto 26.9 复合模型(并行多模型 + 评审合成);自报 Terminal-Bench 4.0 为 51、DeepSWE 为 74;$2.50/$7.50 每百万词元
9 月 21 日 xAI Grok 4.7 $2/$6 每百万词元;自报 Terminal-Bench 4.0 为 37.6%(Grok Build harness)、DeepSWE v1.1 为 71.0%(high effort)、EEBench 64.0;第三方在标准化口径下复测出明显更低的分数
9 月 22 日 Claude Opus 5.5 1M 词元上下文,$4/$20 每百万词元、缓存读 $0.20;当天成为 Claude Code 默认 Opus 模型;自报 Terminal-Bench 4.0 为 66.4%(xhigh effort);同时上调多档订阅的 5 小时用量上限
9 月 22 日 GPT-6 Sol / GPT-6 Luna Sol 定价 $2/$10、Luna $0.10/$0.50 每百万词元;OpenAI 称较 GPT-5.6 促销价便宜 50%;当天进入 Codex;GPT-6 Astra 仍是 Codex 默认模型

需要注意,Opus 5.5 与 Sol/Luna 在资讯线因超出时效窗口未单独成稿,本文是发布潮之后首次以研究院口径做系统性横评。另据 MightyBot 记载,同期还有 Cognition 发布 SWE-2(由 Kimi K3 后训练而来,FrontierCode 1.1 Main 得 50.0%)并整合 Windsurf 为 Devin Desktop、SpaceX 完成对 Cursor 的收购等格局变化——牌桌的洗牌不止发生在模型层。

Terminal-Bench 4.0:拉开 28.8 个百分点的榜单

Terminal-Bench 4.0 是这轮发布潮里分化最大的基准。汇总厂商官方与官方榜单口径:

模型(执行环境) Terminal-Bench 4.0 口径说明
Claude Opus 5.5(Claude Code) 66.4% Anthropic 自报,xhigh effort
GPT-6 Astra(Codex) 57.9%–58.2% OpenAI 自报(两个时间快照略有差异),官方榜单后期快照为 58.2%
Claude Fable 5.1(Claude Code) 55.8% 官方榜单口径(MightyBot 9/18 与 9/24 快照均一致引用)
Grok 4.7(Grok Build) 37.6% xAI 自报,Grok Build harness;第三方标准化复测显著更低
DeepSeek V4.1 Flash(自家 harness) 31.2% DeepSeek 自报,未进官方榜单
Gemini 3.8 Flash 19.1% 对比表转引口径

66.4% 对 19.1%,首尾相差 45.3 个百分点;即便只看头部阵营,Opus 5.5 与 Astra/Fable 5.1 之间也有 8 到 10 个百分点的可见差距。但这个榜单必须带着 harness 标签读:Grok 4.7 的 37.6% 用的是自家 Grok Build,Artificial Analysis 的标准化口径给出过明显更低的数字——同一家评测在不同 harness 下能差出两位数百分点,这在 9 月的评测生态里已经不是新闻而是常态。Anthropic 自己在发布材料里也承认「基准分差作为真实差距指引的可靠性在下降」。

DeepSWE v1.1:贴身 3.2 个百分点的另一面

同样是智能体编码,换到 DeepSWE v1.1 基准上,画风完全不同:

模型 DeepSWE v1.1 口径说明
Claude Opus 5.5 74.2% Anthropic 自报
GPT-6 Astra 74.1% OpenAI 自报(对比口径)
Gemini 3.8 Flash 73.7% 对比表转引口径
Grok 4.7 71.0% xAI 自报,high effort(非 xhigh)

四款模型挤在 3.2 个百分点内,与 Terminal-Bench 4.0 的断层构成一组鲜明对照。怎么解释这种背离?合理的假设有三层:其一,DeepSWE v1.1 的 113 个软件工程任务可能已进入「多数旗舰都能解」的饱和区,区分度衰减;其二,各家的执行环境在 DeepSWE 上趋于同质化,而在 Terminal-Bench 这类长程终端任务上,harness 的上下文管理、重试策略与工具封装差异会被放大;其三,也不能排除厂商「挑好报的基准」的选择性披露——Terminal-Bench 上 Anthropic 领先,DeepSWE 上谁都不落后,每家都有拿得出手的一张表。两条基准合起来读,比单独引用任何一张都更接近真相:模型能力的下限差距在收窄,执行环境的上限差距在拉大。

AutomationBench:谁来执行、谁来报告的口径题

这轮发布潮里口径问题最集中的一个基准是 AutomationBench(业务工作流自动化)。公开对比表给出的数字:

模型 AutomationBench 口径说明
GPT-6 Astra 41.4% Zapier 公开榜单口径
Claude Opus 5.5 40.0% Zapier 执行,Opus 5.5 为早期访问评测
Claude Fable 5.1 31.4% Zapier 公开榜单口径
GPT-5.6 Sol 28.8% Zapier 公开榜单口径
Claude Opus 5 26.9% Zapier 公开榜单口径

这张表的信息量不在名次,而在脚注:AutomationBench 由 Zapier 运行,Opus 5.5 的分数取自早期访问评测,其余对比数字来自 Zapier 公开榜单——这意味着执行环境、任务版本与评测时间都可能存在差异,直接横比要打折扣。此外,Gemini 3.8 Flash 与 Grok 4.7 在已核实的公开材料中没有可比数字,任何把四家厂商填进同一张表的图都制造了虚假的精确。对采购决策者的启示很直接:涉及业务应用操作的基准,先问「谁执行的、什么时候执行的、几个任务」,再谈分数。

成本维度:官方价、任务价与 octobench 实测

模型价格与智能体任务的真实花费是两回事。先看 Artificial Analysis 编码智能体指数(Index v1.5)的系统级排序与配套成本口径:

系统(harness + 模型) AA Coding Agent Index v1.5 备注
Claude Code + Opus 5.5 66 9/22 发售后独立指数同步更新
Claude Code + Fable 5.1 / Codex + GPT-6 Astra / Devin Fusion 62 三家同分
Codex + GPT-6 Sol 57 Sol 定价 $2/$10,主打性价比档
OpenCode + GLM-5.3 约 54 公开图表快照口径,第三方转引

指数的构成值得复述:DeepSWE v1.1(113 任务)、Terminal-Bench 4.0(66 任务)与 SWE-Atlas-QnA(124 任务)三基准等权,每任务三次尝试取 pass@1 均值——它度量的是「系统」(模型 + harness + 上下文 + 提供商路由),不是裸模型,所以 66 分不能读成 Opus 5.5 的模型单分。

任务级成本方面,AA 智能体指数配套公布的单任务成本(注意这是 Intelligence Index 的口径,不是编码会话均价):GPT-6 Astra 为 $3.26,Opus 5.5 为 $5.98,GLM-5.3 为 $2.01,Qwen3.8-27B 为 $1.01——头部与性价比档之间存在约六倍的单任务成本差。

第三方实测层面,Octomind 用 25 个取自 2026 年真实合并 PR 的任务(octobench)跑了四个终端智能体,方法与原始数据全部公开:

智能体 解决任务 判分 API 总花费 总耗时
Octomind(GLM-5.2) 24 / 25 2264 / 2500 $63.43 3.6 小时
Claude Code 23 / 25 2262 $81.79 6.7 小时
Codex CLI 21 / 25 — $14.86 1.0 小时
OpenCode 19 / 25 — $129.54 3.3 小时

样本小、任务集中、发布方自身在榜单内(其原始运行数据公开可复现,作为方法论的诚意值得肯定,但利益相关性必须声明)。即便如此,这组数据揭示的结构性事实有效:解决数只差 5 个任务的四款智能体,套件总花费差出 8.7 倍、墙钟时间差出 6.7 倍——「每分钱买多少完成度」的分化远大于「能做多好」的分化。Codex CLI 以五分之一的花费、六分之一的时长解决 21/25 的成绩,重新定义了「够用档」的性价比基准;未解决的 4 个任务集中在多文件、跨语言的困难段,暴露其攻坚上限。

怎么读这轮发布潮:三条阅读规则

目前官方及行业暂未披露更多细节(如 Sol/Luna 在独立指数上的后续更新、Opus 5.5 的规模化定价影响、各家在 AutomationBench 上的补测计划),后续将持续跟进迭代动态。

核心发现

参考来源

  1. MightyBot — Best AI Coding Agents in 2026, Ranked(2026-09-24 更新版,含 Opus 5.5 / Sol/Luna 发布细节与 AA Coding Agent Index 分数)
  2. Emerging Tech Daily — GPT-6 Astra vs Claude 5.5 vs Gemini vs Grok: Agent Benchmarks(2026-09,Terminal-Bench/DeepSWE/AutomationBench 对比表与口径脚注)
  3. Regolo — Best AI Coding Models in 2026(2026-09-24 核验快照,Index v1.5 构成、单任务成本与 GLM-5.3 数据)
  4. Octomind — The Best AI Coding Agents in 2026, Ranked by Actual Benchmark Data(2026-09,octobench 方法论与原始数据公开仓库)
  5. xAI — Grok 4.7 发布说明(2026-09-21,自报基准与定价;自报口径已在正文标注)