发布概况:1M 输出与分阶段开放
Argon 是 Gemini 4 世代的首款旗舰,也是 Google 自 2025 年 11 月 Gemini 3 系之后的又一次旗舰换代。工程层面最大的变化是输出上限:100 万 token,从此前的 64K 一举提升约 15 倍——Google 给出的理由是长程任务(大型代码库迁移、长文档起草、多源金融研究)需要一个响应就能装下完整工作产物,避免任务中途因输出截断而被迫重启。
但这次发布有一个此前旗舰罕见的特征:发布时公众根本用不上。访问分阶段推进:首先通过 Fairwind 计划交给经过审查的网络防御者(据媒体报道,该通道版本不带常规网络安全护栏),随后才是付费 API 客户与 Google AI Ultra 订阅用户,时间表未公布。也就是说,这张 18 项基准的成绩单,是绝大多数买家短期内仅有的可检验依据是 Argon。
发布时间 2026 年 9 月 30 日(美国太平洋时间下午);100 万 token 输出上限(此前 Gemini 为 64K);引入价格每百万 token 输入 2 美元、输出 10 美元(引入期后 4/20 美元,缓存输入 0.10 美元);首批经 Fairwind 计划向可信网络防御者开放,公开时间未定。
总表:18 项基准的完整盘面
Google 公告随附的对比表覆盖 18 项基准,对手是 GPT-6 Astra、Claude Fable 5.1 与 Claude Opus 5.5。多家媒体独立清点后的结论一致:Argon 12 项 outright 领先、1 项并列、5 项落后。以下整理智能体工作最相关的项目(数据来自 Google 发布图表,经多家媒体交叉转述;对手分数多为各厂商自报或取自公开榜单):
| 基准 | Argon | GPT-6 Astra | Fable 5.1 | Opus 5.5 | 判读 |
|---|---|---|---|---|---|
| DeepSWE v1.1(长程软件工程) | 77.9% | 74.1% | 67.4% | 74.2% | Argon 领先 |
| AutomationBench(企业工作流) | 51.3% | 41.4% | 31.4% | 42.5% | Argon 大幅领先 |
| Harvey 法律智能体基准 | 19.6% | 5.4% | 6.7% | 3.8% | 倍数级领先 |
| Vals Index(知识工作总评) | 68.9% | 63.1% | 65.8% | 67.0% | Argon 领先 |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% | Argon 领先 |
| Terminal-Bench 4.0(终端智能体) | 57.4% | 58.2% | 57.9% | 66.4% | 落后 Opus 5.5 九分 |
| FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% | 落后 Astra 10.5 分 |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% | 落后 Astra 10.5 分 |
| OSWorld 2.0(离线子集,计算机控制) | 69.2% | 72.6% | 未参评 | 未参评 | 落后 Astra 3.4 分 |
| Agent's Last Exam(计算机使用) | 39.5% | 34.2% | 未参评 | 38.2% | Argon 领先 |
| LABBench 2(生物与基因组) | 88.8% | 85.4% | 68.6% | 73.1% | Argon 领先 |
| GraphWalks BFS(256K 至 1M 长上下文) | 84.2% | 71.8% | 65.0% | 66.8% | 百万级上下文优势 |
几个表格脚注决定了读法:Fable 5.1 未提供 Agent's Last Exam 分数;Anthropic 系模型被排除在 OSWorld 2.0 离线子集之外;CWE-bench v1 两家 68% 平手、Google 以 pass@4 决出先后。换句话说,这不是一场全员到齐的同题考试。
领先侧:知识工作与长程自动化
领先项目的分布高度聚焦。Harvey 法律智能体基准上 19.6% 对 5.4%/3.8%/6.7% 是整张表里差距最大的单项——绝对值仍然不高(说明法律智能体任务整体远未解决),但相对差距是倍数级的。Vals Index、Vals Finance Agent v2 与 LABBench 2 同向:知识工作、金融分析与科学文献任务全面领先。AutomationBench(Zapier 参与的工作流自动化基准)51.3% 领先 Opus 5.5 近 9 分,也是Argon 的明显强项。
长上下文项目与 1M 输出上限互为印证:GraphWalks 在 256K 至 1M 区间 Argon 84.2% 对 Fable 5.1 的 65.0%,说明百万级窗口不只是参数表上的数字,检索保真度确实随窗口扩大而衰减得更慢。
Google 同时给了三组内部使用案例(均为厂商自报):数据中心遥测分析智能体找出超过 300 TiB 的内存节省;对已发表的量子计算基线在几分钟内超出 40%;将一个视频解码器改写为内存安全版本、速度提升 2.7 倍且输出一致。这些案例口径无法独立核验,但与「长程、大产物」的产品定位一致。
落败侧:终端编码与计算机控制的失守
落败的 5 项全部集中在编码工具链与计算机控制:Terminal-Bench 4.0 落后 Opus 5.5 达 9 分(57.4% 对 66.4%)、FrontierSWE v2 与 Terminal-Bench Science 均落后 Astra 10.5 分、OSWorld 2.0 落后 Astra 3.4 分。值得注意的是 Google 保留了这些落败行——这张表因此比「全绿」的厂商图表更有阅读价值。
结构与本站此前的多份评测互相呼应:终端编码(Terminal-Bench 系)考验的是 harness 与模型在受限工具面上的多轮试错能力,Anthropic 系在此持续占优;知识工作与长文档则是大规模上下文与推理深度的主场。Argon 的盘面几乎是把这条分界线画了出来:百万 token 输出买来的是知识工作的纵深,不是终端编码的全面性。对选型团队的含义很直接:以终端工程为主的工作流,Opus 5.5 系仍是更稳的选择;以分析、法律、金融、长文档为主的智能体负载,Argon 的账面优势值得在 GA 后实测验证。
Agent's Last Exam 上 Argon 39.5% 领先 Astra 的 34.2%,但 OSWorld 2.0 却落后 3.4 分——两个同为「计算机使用」类基准,方向相反。原因在于任务构造不同:前者偏综合推理、后者偏真实桌面操作的执行细节。同一能力类别内部都有分化,「计算机使用强弱」这种合并表述没有决策价值。
定价与输出上限:被低估的两个变量
先把四款旗舰的公开价格表并排看(口径:Argon 为 Google 官方公告;Opus 5.5 与 Fable 5.1 取自公开模型目录;Astra 为媒体报道口径,均可能有企业折扣等未公开变量):
| 模型 | 输入(美元/百万 token) | 输出(美元/百万 token) | 备注 |
|---|---|---|---|
| Gemini 4 Argon | 2(引入期)→ 4 | 10(引入期)→ 20 | 缓存输入 0.10(约为标准输入 5%) |
| Claude Opus 5.5 | 4 | 20 | Argon 引入期后与之一致 |
| GPT-6 Astra | 10 | 50 | 媒体报道口径 |
| Claude Fable 5.1 | 10 | 50 | 公开模型目录口径 |
引入期定价输入 2 美元/输出 10 美元(每百万 token),引入期后回到 4/20 美元——与 Opus 5.5 持平,显著低于 GPT-6 Astra(据报道 10/50 美元)。缓存输入 0.10 美元约为标准输入价的 5%。对智能体负载而言,价格表的权重不亚于分数表:智能体单任务动辄消耗数十万 token,同分数下两倍价差就足以反转性价比排序。
输出上限同理。100 万 token 输出改变了「什么任务能一次跑完」的边界:Google 称其内部已在用它处理数万行到 80 万行以上(Fuchsia Zircon 内核)的 C/C++ 到 Rust 迁移。但注意两点:其一,满额度输出的单次响应成本可达 10 美元(引入期)到 20 美元(常规价),长输出是真实的账单项;其二,输出上限高不等于输出质量随长度线性保持,这需要独立评测验证。
厂商自选成绩单的四条阅读规则
- 基准集是厂商选的:18 项之外的基准不进对比,「12 项领先」的基数本身就是选择的结果;未披露的项目(如各家的旗舰在其他终端编码基准上的表现)要查第三方榜单补全
- 对手分数多为自报:Astra、Fable 5.1、Opus 5.5 的数字主要来自各自厂商或公开榜单,设置(thinking 档位、工具开闭)未必与 Argon 的最高档位对齐,跨表比较要留有余量
- 落败行的价值高于领先行:领先项说明「投入了什么」,落败项才暴露「边界在哪」;Google 保留落败行值得肯定,但也应注意到 OSWorld 2.0 排除了 Anthropic 系这类结构性缺席
- GA 之前一切以独立复现为准:模型尚未公开访问,成绩单是仅有的窗口;本站对历次厂商发布的追踪一再表明,公开可用后的第三方实测与发布图表存在差距是常态而非例外
目前官方及行业暂未披露更多细节(如 GA 时间表、完整技术报告的方法学细节与公平定价的结束时间),后续将持续跟进迭代动态。