能力评测 2026-10-01 21 分钟阅读 进阶

Gemini 4 Argon 智能体成绩单:18 项基准里的领先与落败

12 项领先、5 项落败 — 知识工作大胜、终端编码失守的结构比「赢了几项」更有信息量,以及一张厂商自选基准表该怎么读

摘要

2026 年 9 月 30 日,Google 发布 Gemini 4 系首款旗舰模型 Argon:输出上限从 64K 提升到 100 万 token,随官方公告给出一张 18 项基准、对比 GPT-6 Astra、Claude Fable 5.1 与 Claude Opus 5.5 的成绩单。本文逐行拆解这张表的智能体相关项目:Argon 在 DeepSWE v1.1(77.9%)、AutomationBench(51.3%)与 Harvey 法律智能体基准(19.6%)大幅领先,却在 Terminal-Bench 4.0 落后 Opus 5.5 九分、在 OSWorld 2.0 落后 Astra 3.4 分。比输赢更重要的是结构——知识工作与终端编码的分野、厂商自选基准集的选择效应、以及尚未开放公开访问带来的验证真空。所有对比分数多为厂商自报,文中已逐项标注。

发布概况:1M 输出与分阶段开放

Argon 是 Gemini 4 世代的首款旗舰,也是 Google 自 2025 年 11 月 Gemini 3 系之后的又一次旗舰换代。工程层面最大的变化是输出上限:100 万 token,从此前的 64K 一举提升约 15 倍——Google 给出的理由是长程任务(大型代码库迁移、长文档起草、多源金融研究)需要一个响应就能装下完整工作产物,避免任务中途因输出截断而被迫重启。

但这次发布有一个此前旗舰罕见的特征:发布时公众根本用不上。访问分阶段推进:首先通过 Fairwind 计划交给经过审查的网络防御者(据媒体报道,该通道版本不带常规网络安全护栏),随后才是付费 API 客户与 Google AI Ultra 订阅用户,时间表未公布。也就是说,这张 18 项基准的成绩单,是绝大多数买家短期内仅有的可检验依据是 Argon。

🔑 发布要点速览

发布时间 2026 年 9 月 30 日(美国太平洋时间下午);100 万 token 输出上限(此前 Gemini 为 64K);引入价格每百万 token 输入 2 美元、输出 10 美元(引入期后 4/20 美元,缓存输入 0.10 美元);首批经 Fairwind 计划向可信网络防御者开放,公开时间未定。

总表:18 项基准的完整盘面

Google 公告随附的对比表覆盖 18 项基准,对手是 GPT-6 Astra、Claude Fable 5.1 与 Claude Opus 5.5。多家媒体独立清点后的结论一致:Argon 12 项 outright 领先、1 项并列、5 项落后。以下整理智能体工作最相关的项目(数据来自 Google 发布图表,经多家媒体交叉转述;对手分数多为各厂商自报或取自公开榜单):

基准 Argon GPT-6 Astra Fable 5.1 Opus 5.5 判读
DeepSWE v1.1(长程软件工程) 77.9% 74.1% 67.4% 74.2% Argon 领先
AutomationBench(企业工作流) 51.3% 41.4% 31.4% 42.5% Argon 大幅领先
Harvey 法律智能体基准 19.6% 5.4% 6.7% 3.8% 倍数级领先
Vals Index(知识工作总评) 68.9% 63.1% 65.8% 67.0% Argon 领先
Vals Finance Agent v2 65.4% 53.5% 58.9% 58.6% Argon 领先
Terminal-Bench 4.0(终端智能体) 57.4% 58.2% 57.9% 66.4% 落后 Opus 5.5 九分
FrontierSWE v2 55.0% 65.5% 56.3% 62.3% 落后 Astra 10.5 分
Terminal-Bench Science 0.1 57.6% 68.1% 52.6% 63.3% 落后 Astra 10.5 分
OSWorld 2.0(离线子集,计算机控制) 69.2% 72.6% 未参评 未参评 落后 Astra 3.4 分
Agent's Last Exam(计算机使用) 39.5% 34.2% 未参评 38.2% Argon 领先
LABBench 2(生物与基因组) 88.8% 85.4% 68.6% 73.1% Argon 领先
GraphWalks BFS(256K 至 1M 长上下文) 84.2% 71.8% 65.0% 66.8% 百万级上下文优势

几个表格脚注决定了读法:Fable 5.1 未提供 Agent's Last Exam 分数;Anthropic 系模型被排除在 OSWorld 2.0 离线子集之外;CWE-bench v1 两家 68% 平手、Google 以 pass@4 决出先后。换句话说,这不是一场全员到齐的同题考试。

领先侧:知识工作与长程自动化

领先项目的分布高度聚焦。Harvey 法律智能体基准上 19.6% 对 5.4%/3.8%/6.7% 是整张表里差距最大的单项——绝对值仍然不高(说明法律智能体任务整体远未解决),但相对差距是倍数级的。Vals Index、Vals Finance Agent v2 与 LABBench 2 同向:知识工作、金融分析与科学文献任务全面领先。AutomationBench(Zapier 参与的工作流自动化基准)51.3% 领先 Opus 5.5 近 9 分,也是Argon 的明显强项。

长上下文项目与 1M 输出上限互为印证:GraphWalks 在 256K 至 1M 区间 Argon 84.2% 对 Fable 5.1 的 65.0%,说明百万级窗口不只是参数表上的数字,检索保真度确实随窗口扩大而衰减得更慢。

Google 同时给了三组内部使用案例(均为厂商自报):数据中心遥测分析智能体找出超过 300 TiB 的内存节省;对已发表的量子计算基线在几分钟内超出 40%;将一个视频解码器改写为内存安全版本、速度提升 2.7 倍且输出一致。这些案例口径无法独立核验,但与「长程、大产物」的产品定位一致。

落败侧:终端编码与计算机控制的失守

落败的 5 项全部集中在编码工具链与计算机控制:Terminal-Bench 4.0 落后 Opus 5.5 达 9 分(57.4% 对 66.4%)、FrontierSWE v2 与 Terminal-Bench Science 均落后 Astra 10.5 分、OSWorld 2.0 落后 Astra 3.4 分。值得注意的是 Google 保留了这些落败行——这张表因此比「全绿」的厂商图表更有阅读价值。

结构与本站此前的多份评测互相呼应:终端编码(Terminal-Bench 系)考验的是 harness 与模型在受限工具面上的多轮试错能力,Anthropic 系在此持续占优;知识工作与长文档则是大规模上下文与推理深度的主场。Argon 的盘面几乎是把这条分界线画了出来:百万 token 输出买来的是知识工作的纵深,不是终端编码的全面性。对选型团队的含义很直接:以终端工程为主的工作流,Opus 5.5 系仍是更稳的选择;以分析、法律、金融、长文档为主的智能体负载,Argon 的账面优势值得在 GA 后实测验证。

💡 一个反直觉细节

Agent's Last Exam 上 Argon 39.5% 领先 Astra 的 34.2%,但 OSWorld 2.0 却落后 3.4 分——两个同为「计算机使用」类基准,方向相反。原因在于任务构造不同:前者偏综合推理、后者偏真实桌面操作的执行细节。同一能力类别内部都有分化,「计算机使用强弱」这种合并表述没有决策价值。

定价与输出上限:被低估的两个变量

先把四款旗舰的公开价格表并排看(口径:Argon 为 Google 官方公告;Opus 5.5 与 Fable 5.1 取自公开模型目录;Astra 为媒体报道口径,均可能有企业折扣等未公开变量):

模型 输入(美元/百万 token) 输出(美元/百万 token) 备注
Gemini 4 Argon 2(引入期)→ 4 10(引入期)→ 20 缓存输入 0.10(约为标准输入 5%)
Claude Opus 5.5 4 20 Argon 引入期后与之一致
GPT-6 Astra 10 50 媒体报道口径
Claude Fable 5.1 10 50 公开模型目录口径

引入期定价输入 2 美元/输出 10 美元(每百万 token),引入期后回到 4/20 美元——与 Opus 5.5 持平,显著低于 GPT-6 Astra(据报道 10/50 美元)。缓存输入 0.10 美元约为标准输入价的 5%。对智能体负载而言,价格表的权重不亚于分数表:智能体单任务动辄消耗数十万 token,同分数下两倍价差就足以反转性价比排序。

输出上限同理。100 万 token 输出改变了「什么任务能一次跑完」的边界:Google 称其内部已在用它处理数万行到 80 万行以上(Fuchsia Zircon 内核)的 C/C++ 到 Rust 迁移。但注意两点:其一,满额度输出的单次响应成本可达 10 美元(引入期)到 20 美元(常规价),长输出是真实的账单项;其二,输出上限高不等于输出质量随长度线性保持,这需要独立评测验证。

厂商自选成绩单的四条阅读规则

  1. 基准集是厂商选的:18 项之外的基准不进对比,「12 项领先」的基数本身就是选择的结果;未披露的项目(如各家的旗舰在其他终端编码基准上的表现)要查第三方榜单补全
  2. 对手分数多为自报:Astra、Fable 5.1、Opus 5.5 的数字主要来自各自厂商或公开榜单,设置(thinking 档位、工具开闭)未必与 Argon 的最高档位对齐,跨表比较要留有余量
  3. 落败行的价值高于领先行:领先项说明「投入了什么」,落败项才暴露「边界在哪」;Google 保留落败行值得肯定,但也应注意到 OSWorld 2.0 排除了 Anthropic 系这类结构性缺席
  4. GA 之前一切以独立复现为准:模型尚未公开访问,成绩单是仅有的窗口;本站对历次厂商发布的追踪一再表明,公开可用后的第三方实测与发布图表存在差距是常态而非例外

目前官方及行业暂未披露更多细节(如 GA 时间表、完整技术报告的方法学细节与公平定价的结束时间),后续将持续跟进迭代动态。

核心发现

参考来源

  1. Google 官方公告 — Gemini 4 Argon 发布图表与评估方法学(2026.09.30,经 ai-tldr.dev 与 llmlearner 收录的原始分数表交叉)
  2. Gadgets Now — Gemini 4 Argon Leads GPT-6 Astra and Claude Opus 5.5 on 12 of 18 Benchmarks(2026.10)
  3. Valletta Software — Gemini 4 Argon Is Here: 1M Output Tokens(2026.10,含 18 项基准完整对照表与脚注)
  4. AIbars — Gemini 4 Argon Debuts With 1M-Token Output, 77.9% on DeepSWE and 2 Dollars Pricing(2026.10)
  5. HashLytics — Gemini 4 Argon Tops Benchmarks, Ships Without Guardrails(2026.10,含 Fairwind 护栏口径辨析)
  6. AI/TLDR — Gemini 4 Argon 模型页(含官方技术报告链接与内部使用案例转述)