发布全景:一次 harness 级别的换代
2026 年 9 月 17 日,Google 在 AI Studio 与 Gemini Interactions API 中上线了新的托管智能体运行时 antigravity-preview-09-2026。官方对其定位非常明确:把 Antigravity 编码智能体的工具集与行为模式,整体搬进 Gemini API 的托管智能体体系。默认底层模型为 Gemini 3.8 Flash,且支持按次交互配置切换模型。
这次更新包含三件事:
- 新 harness:antigravity-preview-09-2026 取代此前的 antigravity-preview-05-2026,后者将于 2026 年 10 月 5 日弃用,届时请求自动重定向;
- Files API:解决数据进出沙盒的问题——上传输入、列出产出、下载成果;
- Credentials API:解决智能体调用外部服务时的密钥安全问题——令牌在服务端托管,通过出站代理按需注入,模型上下文从头到尾不接触明文凭据。
模型能力趋同的背景下,harness(执行内核)正在成为差异化主战场:同一个大模型底座,执行循环、上下文预算、文件编辑方式与凭据发放策略的差异,直接决定智能体产品的可用性与成本。Google 这次更新的实质,是把自家 IDE 级编码智能体的执行经验,沉淀为可按次调用的托管基础设施。
运行时解剖:计划-行动-观察循环与托管沙盒
一次 ai.interactions.create() 调用即可在 Gemini API 托管的隔离 Linux 沙盒中拉起一个智能体:它接收目标,规划步骤,执行动作,观察结果,循环往复直至任务完成或触及上下文与 token 上限。官方示例展示了完整链路——克隆开源仓库、定位全部弃用参数、批量迁移、跑通测试套件、写变更日志。
开箱能力清单
| 能力 | 说明 |
|---|---|
| 代码执行 | code_execution 在沙盒内运行 bash,Python、Node、git 及终端可用的工具链均可调用 |
| 文件系统工具 | 需配合 environment 使用:读、写、编辑、搜索、列目录 |
| 联网能力 | google_search 与 url_context 两类内置工具 |
| 自定义函数工具 | 接入开发者自有系统的回调工具 |
| 远程 MCP 服务器 | mcp_server 类型工具直连既有 MCP 服务 |
| 自动上下文压缩 | 约 135K tokens 处自动压缩,长会话不中断 |
两层配置模型
harness 的配置分两层:agent_config 可在单次调用内联指定(模型选择、max_total_tokens 花费上限、工具白名单);也可以通过 agents.create() 把配置固化为可复用的托管智能体,之后按 ID 调用。官方给出的范例是一个只读检索智能体:限定 google_search 与 url_context 两种工具、总 token 预算 50 万、模型换成更便宜的 Flash Lite 变体——权限最小化与成本封顶被做成了原生字段,而不是事后补丁。
沙盒环境通过 environment_id 在多轮交互间持久:二次交互引用同一环境 ID 与前次交互 ID,即可在上一轮产出的文件与已安装依赖之上继续工作。按第三方对官方文档的整理,仓库挂载上限约 500MB,Cloud Storage 挂载约 2GB,内联文件每个 1MB、合计 2MB(文档口径,具体以官方为准)。
Files API:把沙盒变成可寻址的数据面
在新 harness 之前,取出智能体产物的方式要么是从模型文本回复里解析,要么自建围绕沙盒的上传下载管道。Files API 把这两类脏活收编为标准接口:
| 接口 | 职责 | 典型用途 |
|---|---|---|
| files.upload() | 把数据送入运行中的沙盒 | 首轮上传原始数据表;中途追加补充材料 |
| files.list() | 列出智能体产出的文件与目录大小 | 盘点产出物 |
| files.download() | 取回指定文件或目录 | 下载报告、仪表盘、CSV、改好的仓库 |
官方给的场景很直白:丢进一份原始销售数据表,让智能体产出一份可直接使用的交互式仪表盘,再把成品文件取回。数据面与应用面的分离,让「智能体工作区」从一次性代码执行调用,升级为可续作的状态载体——上传三季度数据、基于上轮已建好的仪表盘扩展四季度视图,是文档明确支持的用法。
Credentials API:密钥永不进模型的安全设计
这是本次更新中安全权重最高的部分。此前要让 Gemini 智能体访问内部 MCP 服务器或 OAuth 保护的第三方 API,开发者要么把凭据写进提示词(一次提示注入就可能外泄),要么自建代理层。Credentials API 的方案是三段式:
- 凭据注册:三类凭据——bearer_token(适配带 Authorization 头的 MCP 服务器与 API)、oauth2(Google 会在过期前自动刷新轮换)、environment_variable(给沙盒一个占位符,供 curl 或 SDK 调用,并受 trusted_domains 白名单约束);
- 出站代理:沙盒的外发请求经由托管代理,仅放行显式批准的目的地,并在连接点注入认证头;
- 上下文隔离:官方声明明文密钥不会进入模型上下文、标准输出或智能体记忆。
这与此前提到的 OpenAI Agents API「harness 与 compute 分离」是同一条设计公理的两个实现:模型产出的内容,永远不应该与凭据共处一个隔离域。区别在于 OpenAI 把执行环境开放给九家沙箱伙伴,Google 则把凭据治理做成自家 API 的内建能力——一个走开放生态路线,一个走纵深集成路线。
性能账本:官方自报数字的正确读法
官方随发布给出了三组自报数据,全部来自内部评测而非公开基准:
| 指标 | 官方口径 | 说明 |
|---|---|---|
| 文件编辑输出 token | −40% | 新 harness 以统一 diff 方式产出编辑,替代整文件重写;对多文件连续小改动的编码任务收益按次数复利 |
| 缓存命中率 | 多轮编码/研究 +9%,长问答 +22% | 系统指令稳定化带来更确定的缓存前缀;缓存读取按远低于新输入的价格计费 |
| 任务成本 | 推理任务 −17%,多轮编码 −30% | 由缓存收益传导;非普适保证,随负载结构浮动 |
| 任务完成率 | 多轮软件工程/研究 +约 8% | 内部评测口径,官方文档未独立复现路径 |
如何读这份账本:这些数字是厂商自报的工作负载相关结果,不是可以外推的通用基准。第三方观察者也指出,官方文档证实了新模型、托管智能体能力与两个新 API 的存在,但未对 40% 这类数字提供独立验证路径。稳妥的做法是把它们当作「值得重测成本基线的信号」,而非默认收益。10 月 5 日旧版弃用前重跑一次自己的成本基线,是本次发布给存量用户的直接行动项。
迁移与兼容:10 月 5 日切换窗口
官方承诺 antigravity-preview-05-2026 上的既有请求在新版「原样可用」,定价不变。但有一处破坏性变更必须处理:step 事件中的工具名称变了——文件工具现在上报为 view_file、write_to_file、replace_file_content 等新名。任何按旧工具名过滤 step 事件的下游代码,都需要在切换前更新。
| 迁移项 | 状态 | 行动建议 |
|---|---|---|
| 既有请求兼容 | 官方声明无需改动 | 回归测试验证即可 |
| step 事件工具名 | 破坏性变更 | 排查事件过滤与监控解析逻辑 |
| 旧版弃用 | 2026-10-05 起自动重定向 | 在截止前完成验证,避免重定向掩盖问题 |
| 定价 | 不变 | 据第三方报道,Flash 系列定价 2027 年 1 月 1 日起调整,长期成本模型需另行测算(转述口径,以官方定价页为准) |
三家对比:harness 托管化的路线分野
把时间线拉齐看,2026 年三大厂商先后把智能体执行底座收进托管服务:
| 维度 | Google(本次) | OpenAI Agents API | Anthropic Managed Agents |
|---|---|---|---|
| 时间 | 2026-09-17 | 2026-09-10 公测 | 2026 年 4 月随 Claude Cowork GA |
| 执行环境 | 自家托管 Linux 沙盒 | 官方沙盒或九家伙伴(Blaxel、Cloudflare、Daytona、E2B、Modal 等) | 随 Claude 企业体系的托管执行 |
| 密钥治理 | Credentials API + 出站代理 | harness 与 compute 隔离,凭据不进模型环境 | 策略层治理(Managed Agents 定位) |
| 状态复用 | environment_id + Files API | durable Session + 快照重水合 | 会话与技能(Skills)体系 |
| 路线取向 | 纵深集成:治理内建 | 开放生态:沙盒可插拔 | 企业策略层:治理优先 |
两周之内 OpenAI 与 Google 先后动作,并非巧合:当模型底座能力差距收窄,「把执行底座标准化」就成为平台锁定的新抓手。对开发者而言,选择哪家托管 harness,实质是在选一套治理模型与迁移成本的组合——这与选择框架时代的「选生态」是同一类决策,只是决策对象从代码库变成了基础设施。
局限与争议
- 自报数据无独立验证:40% token 节省、8% 完成率提升等均为内部评测,第三方无法从官方文档复现验证路径
- 预览版标签:名称中保留 preview,代表 API 面仍可能变动;此前版本 5 个月即被换代,长周期项目需评估跟进成本
- 锁定效应:Files/Credentials API 深度绑定 Gemini 生态,跨厂商迁移成本随使用加深而上升
- 资源上限待实测:挂载大小、token 上限等限制的官方口径散落在文档不同位置,生产级工作负载的边界需自行压测
- 定价变量:定价暂不变,但第三方报道的 2027 年调价预期意味着当前成本测算有保质期;该部署的长期 TCO 构成,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态