两周三圈牌:9 月发布潮时间线
把 9 月的编码智能体相关发布按时间排开,密度相当罕见:
| 日期(2026 年) | 发布 | 关键参数与公开口径 |
|---|---|---|
| 9 月 10 日 | DeepSeek V4.1 Flash | 552B 参数 MoE、1M 词元上下文、MIT 许可权重;错峰 $0.15/$0.60、高峰 $0.30/$1.20 每百万词元;自报 Terminal-Bench 4.0 为 31.2%(自家 harness,未上官方榜) |
| 9 月 17 日 | Unbiased Pareto 26.9 | 复合模型(并行多模型 + 评审合成);自报 Terminal-Bench 4.0 为 51、DeepSWE 为 74;$2.50/$7.50 每百万词元 |
| 9 月 21 日 | xAI Grok 4.7 | $2/$6 每百万词元;自报 Terminal-Bench 4.0 为 37.6%(Grok Build harness)、DeepSWE v1.1 为 71.0%(high effort)、EEBench 64.0;第三方在标准化口径下复测出明显更低的分数 |
| 9 月 22 日 | Claude Opus 5.5 | 1M 词元上下文,$4/$20 每百万词元、缓存读 $0.20;当天成为 Claude Code 默认 Opus 模型;自报 Terminal-Bench 4.0 为 66.4%(xhigh effort);同时上调多档订阅的 5 小时用量上限 |
| 9 月 22 日 | GPT-6 Sol / GPT-6 Luna | Sol 定价 $2/$10、Luna $0.10/$0.50 每百万词元;OpenAI 称较 GPT-5.6 促销价便宜 50%;当天进入 Codex;GPT-6 Astra 仍是 Codex 默认模型 |
需要注意,Opus 5.5 与 Sol/Luna 在资讯线因超出时效窗口未单独成稿,本文是发布潮之后首次以研究院口径做系统性横评。另据 MightyBot 记载,同期还有 Cognition 发布 SWE-2(由 Kimi K3 后训练而来,FrontierCode 1.1 Main 得 50.0%)并整合 Windsurf 为 Devin Desktop、SpaceX 完成对 Cursor 的收购等格局变化——牌桌的洗牌不止发生在模型层。
Terminal-Bench 4.0:拉开 28.8 个百分点的榜单
Terminal-Bench 4.0 是这轮发布潮里分化最大的基准。汇总厂商官方与官方榜单口径:
| 模型(执行环境) | Terminal-Bench 4.0 | 口径说明 |
|---|---|---|
| Claude Opus 5.5(Claude Code) | 66.4% | Anthropic 自报,xhigh effort |
| GPT-6 Astra(Codex) | 57.9%–58.2% | OpenAI 自报(两个时间快照略有差异),官方榜单后期快照为 58.2% |
| Claude Fable 5.1(Claude Code) | 55.8% | 官方榜单口径(MightyBot 9/18 与 9/24 快照均一致引用) |
| Grok 4.7(Grok Build) | 37.6% | xAI 自报,Grok Build harness;第三方标准化复测显著更低 |
| DeepSeek V4.1 Flash(自家 harness) | 31.2% | DeepSeek 自报,未进官方榜单 |
| Gemini 3.8 Flash | 19.1% | 对比表转引口径 |
66.4% 对 19.1%,首尾相差 45.3 个百分点;即便只看头部阵营,Opus 5.5 与 Astra/Fable 5.1 之间也有 8 到 10 个百分点的可见差距。但这个榜单必须带着 harness 标签读:Grok 4.7 的 37.6% 用的是自家 Grok Build,Artificial Analysis 的标准化口径给出过明显更低的数字——同一家评测在不同 harness 下能差出两位数百分点,这在 9 月的评测生态里已经不是新闻而是常态。Anthropic 自己在发布材料里也承认「基准分差作为真实差距指引的可靠性在下降」。
DeepSWE v1.1:贴身 3.2 个百分点的另一面
同样是智能体编码,换到 DeepSWE v1.1 基准上,画风完全不同:
| 模型 | DeepSWE v1.1 | 口径说明 |
|---|---|---|
| Claude Opus 5.5 | 74.2% | Anthropic 自报 |
| GPT-6 Astra | 74.1% | OpenAI 自报(对比口径) |
| Gemini 3.8 Flash | 73.7% | 对比表转引口径 |
| Grok 4.7 | 71.0% | xAI 自报,high effort(非 xhigh) |
四款模型挤在 3.2 个百分点内,与 Terminal-Bench 4.0 的断层构成一组鲜明对照。怎么解释这种背离?合理的假设有三层:其一,DeepSWE v1.1 的 113 个软件工程任务可能已进入「多数旗舰都能解」的饱和区,区分度衰减;其二,各家的执行环境在 DeepSWE 上趋于同质化,而在 Terminal-Bench 这类长程终端任务上,harness 的上下文管理、重试策略与工具封装差异会被放大;其三,也不能排除厂商「挑好报的基准」的选择性披露——Terminal-Bench 上 Anthropic 领先,DeepSWE 上谁都不落后,每家都有拿得出手的一张表。两条基准合起来读,比单独引用任何一张都更接近真相:模型能力的下限差距在收窄,执行环境的上限差距在拉大。
AutomationBench:谁来执行、谁来报告的口径题
这轮发布潮里口径问题最集中的一个基准是 AutomationBench(业务工作流自动化)。公开对比表给出的数字:
| 模型 | AutomationBench | 口径说明 |
|---|---|---|
| GPT-6 Astra | 41.4% | Zapier 公开榜单口径 |
| Claude Opus 5.5 | 40.0% | Zapier 执行,Opus 5.5 为早期访问评测 |
| Claude Fable 5.1 | 31.4% | Zapier 公开榜单口径 |
| GPT-5.6 Sol | 28.8% | Zapier 公开榜单口径 |
| Claude Opus 5 | 26.9% | Zapier 公开榜单口径 |
这张表的信息量不在名次,而在脚注:AutomationBench 由 Zapier 运行,Opus 5.5 的分数取自早期访问评测,其余对比数字来自 Zapier 公开榜单——这意味着执行环境、任务版本与评测时间都可能存在差异,直接横比要打折扣。此外,Gemini 3.8 Flash 与 Grok 4.7 在已核实的公开材料中没有可比数字,任何把四家厂商填进同一张表的图都制造了虚假的精确。对采购决策者的启示很直接:涉及业务应用操作的基准,先问「谁执行的、什么时候执行的、几个任务」,再谈分数。
成本维度:官方价、任务价与 octobench 实测
模型价格与智能体任务的真实花费是两回事。先看 Artificial Analysis 编码智能体指数(Index v1.5)的系统级排序与配套成本口径:
| 系统(harness + 模型) | AA Coding Agent Index v1.5 | 备注 |
|---|---|---|
| Claude Code + Opus 5.5 | 66 | 9/22 发售后独立指数同步更新 |
| Claude Code + Fable 5.1 / Codex + GPT-6 Astra / Devin Fusion | 62 | 三家同分 |
| Codex + GPT-6 Sol | 57 | Sol 定价 $2/$10,主打性价比档 |
| OpenCode + GLM-5.3 | 约 54 | 公开图表快照口径,第三方转引 |
指数的构成值得复述:DeepSWE v1.1(113 任务)、Terminal-Bench 4.0(66 任务)与 SWE-Atlas-QnA(124 任务)三基准等权,每任务三次尝试取 pass@1 均值——它度量的是「系统」(模型 + harness + 上下文 + 提供商路由),不是裸模型,所以 66 分不能读成 Opus 5.5 的模型单分。
任务级成本方面,AA 智能体指数配套公布的单任务成本(注意这是 Intelligence Index 的口径,不是编码会话均价):GPT-6 Astra 为 $3.26,Opus 5.5 为 $5.98,GLM-5.3 为 $2.01,Qwen3.8-27B 为 $1.01——头部与性价比档之间存在约六倍的单任务成本差。
第三方实测层面,Octomind 用 25 个取自 2026 年真实合并 PR 的任务(octobench)跑了四个终端智能体,方法与原始数据全部公开:
| 智能体 | 解决任务 | 判分 | API 总花费 | 总耗时 |
|---|---|---|---|---|
| Octomind(GLM-5.2) | 24 / 25 | 2264 / 2500 | $63.43 | 3.6 小时 |
| Claude Code | 23 / 25 | 2262 | $81.79 | 6.7 小时 |
| Codex CLI | 21 / 25 | — | $14.86 | 1.0 小时 |
| OpenCode | 19 / 25 | — | $129.54 | 3.3 小时 |
样本小、任务集中、发布方自身在榜单内(其原始运行数据公开可复现,作为方法论的诚意值得肯定,但利益相关性必须声明)。即便如此,这组数据揭示的结构性事实有效:解决数只差 5 个任务的四款智能体,套件总花费差出 8.7 倍、墙钟时间差出 6.7 倍——「每分钱买多少完成度」的分化远大于「能做多好」的分化。Codex CLI 以五分之一的花费、六分之一的时长解决 21/25 的成绩,重新定义了「够用档」的性价比基准;未解决的 4 个任务集中在多文件、跨语言的困难段,暴露其攻坚上限。
怎么读这轮发布潮:三条阅读规则
- 规则一:看分化结构,不看单榜名次。Terminal-Bench 拉开 45 分、DeepSWE 挤在 3 分内,说明头部模型在「代码智能体基础能力」上趋同、在「长程终端执行」上分化。选型时先判断自己的任务更靠近哪一侧:短链路代码修改看 DeepSWE 型基准即可,多步骤运维/终端作业必须看 Terminal-Bench 型基准。
- 规则二:每分都要问三件事——谁执行、谁报告、什么档位。Grok 4.7 的 37.6% 是 Grok Build 自报、Opus 5.5 的 66.4% 是 xhigh 档、AutomationBench 由 Zapier 执行且 Opus 5.5 是早期访问——没有 harness 标签与 effort 档位的分数不具备可比性。这轮发布潮恰好把「harness 决定论」从评测圈共识变成了厂商自己的官方措辞。
- 规则三:把「按任务配模型」当作默认策略。MightyBot 在 9 月榜单更新中重申了 7 月以来的结构性观察:表现好的团队用贵模型做规划、用便宜模型并行执行。9/22 双发的产品矩阵本身就在配合这种用法——Sol/Luna 的定价梯度($2/$10 与 $0.10/$0.50)就是在给「规划用 Astra、执行用 Luna」的组合拳供给弹药。对工程团队而言,选型问题正在从「用哪个模型」变成「用什么分配策略」。
目前官方及行业暂未披露更多细节(如 Sol/Luna 在独立指数上的后续更新、Opus 5.5 的规模化定价影响、各家在 AutomationBench 上的补测计划),后续将持续跟进迭代动态。