实战 📋 7 个步骤 第 204 / 446 篇

Gemini 3.5 Flash 内置 computer_use:一次调用让 AI 看截图、点界面、跑长任务

2026 年 6 月 24 日,Google 将 computer use 作为 Gemini 3.5 Flash 的内置工具正式发布——无需单独的预览模型,一次调用即可看截图、推理 UI、执行浏览器 / 桌面 / 移动端操作。本教程还覆盖 Managed Agents 后台执行、远程 MCP 集成与 Interactions API(Flex Tier 便宜 50%),手把手教你跑通第一个 Gemini 浏览器智能体。

2026.07.30· 20 分钟阅读· 约 1319 字· 💠 Gemini computer_use / 🤖 浏览器 Agent

2026 年 6 月 24 日,Google 把 computer use(计算机操作)作为 Gemini 3.5 Flash 的内置工具正式发布。过去这需要单独的预览模型,现在一次 google/gemini-3.5-flash 调用就能完成:看截图、推理 UI 元素、在浏览器 / 桌面 / 移动端执行操作。与之同来的还有 Managed Agents 后台执行、远程 MCP 集成,以及 Interactions API 正式版(Flex Tier 便宜约 50%,约 2 分钟延迟 SLA)。本教程带你把这套 Gemini 浏览器智能体跑起来。

💠 本教程适合:已经会调 LLM API、想给智能体加上「操作图形界面」能力的开发者。你只需要一个 Google AI Studio 或 Vertex 的 API Key。

先搞懂:内置 computer_use 变了什么

用一句话理解:以前「看界面 + 想 + 动手」是三个模型接力,现在是同一个 Gemini 3.5 Flash 一次搞定。变化很关键:

维度旧方案内置 computer_use
模型主模型 + 单独预览模型单一 gemini-3.5-flash
调用多次往返一次调用看截图并执行
环境多为浏览器浏览器 / 桌面 / 移动端

一次调用省的是架构复杂度,不是魔法。它依然会截屏、推理、产出动作序列,只是这些现在由同一模型连贯完成,工程上简单很多。

Step 1:拿到 Key 并启用工具

1 把 computer_use 工具打开
1. 去 Google AI Studio(或 Vertex AI)创建 API Key
2. 在请求里启用内置工具 computer_use_google
3. 设好环境变量:
   export GEMINI_API_KEY="AIza-xxxxxxxx"
💡 新手提示:Key 是花钱凭证,别公开。第一次用免费额度足够练手;Flex Tier 上线后长任务更省。

Step 2:跑通第一个 computer_use 调用

2 让模型看截图并点界面
import google.generativeai as genai
genai.configure(api_key=GEMINI_API_KEY)

# 启用内置 computer_use 工具
model = genai.GenerativeModel(
    "gemini-3.5-flash",
    tools=[{"name": "computer_use_google"}],
)
resp = model.generate_content(
    "打开 example.com,找到搜索框,搜 AI news,告诉我第一条标题"
)
print(resp.text)

首次运行要给模型「眼睛」。computer_use 依赖页面截图作为输入,确保你的运行环境能把当前界面截图喂给模型(本地用截图工具,云端用托管浏览器)。

Step 3:用 Managed Agents 跑后台长任务

3 派一个 Agent 在后台慢慢干

有些任务要跑几分钟甚至更久,Managed Agents 让你派出去后先去忙别的:

# 示意:把长任务交给后台 Managed Agent
agent = client.managed_agents.create(
    model="gemini-3.5-flash",
    task="每隔 10 分钟查一次竞品价格,有变动就记下来,跑 1 小时",
)
# 之后轮询结果,不必阻塞等待
result = client.managed_agents.get(agent.id)
🚀 Managed Agents 改变的是「你不用陪跑」。适合监控、巡检、长流程采集这类耗时任务,和本中心《主动式 Agent 实战》思路一致。

Step 4:接远程 MCP 服务器扩展能力

4 让 Gemini 智能体用上外部工具
# 把远程 MCP 服务器挂给 Agent,扩展它能调的工具
model = genai.GenerativeModel(
    "gemini-3.5-flash",
    tools=[
        {"name": "computer_use_google"},
        {"mcp_server": "https://your-mcp.example.com/sse"},
    ],
)
# 现在它能边看界面,边查数据库 / 调内部 API

MCP 是能力倍增器。computer_use 解决「操作界面」,MCP 解决「调用后端系统」,两者一组合,智能体才是完整的数字员工,而不只是个会点按钮的脚本。

Step 5:用 Interactions API + Flex Tier 路由

5 长任务走便宜通道
# Interactions API 正式版支持 Flex Tier:便宜约 50%,约 2 分钟延迟 SLA
# 适合不要求秒回的后台交互任务
client.interactions.run(
    model="gemini-3.5-flash",
    tier="flex",          # flex / standard
    prompt="整理这份周报草稿,半小时内回我就行",
)
🔑 关键成本技巧:实时交互走 standard,后台批量走 flex。把两者分开路由,账单能省一大截——这正是《Agent 预算护栏》要你做的。

Step 6:安全防护:截图与权限

6 能看界面,也要防泄露
# 护栏建议
{
  "block_sensitive_screenshot": true,  // 含密码/卡号区域不打给模型
  "allow_domains": ["example.com"],    // 只允许操作白名单站点
  "confirm_high_risk": true            // 提交/支付等动作人工确认
}

截图可能含敏感信息。computer_use 的「眼睛」会看到屏幕上一切,务必屏蔽敏感区域、限制可操作域名,并把高危动作接人工确认。

Step 7:落地检查清单

7 上线前用这张表过一遍
□ computer_use_google 工具是否启用、截图能否喂入?
□ 长任务是否交给 Managed Agents 后台跑?
□ 是否通过 MCP 接了必要的后端工具?
□ 后台批量是否走 Flex Tier 省成本?
□ 敏感截图是否屏蔽、域名是否白名单?
□ 提交/支付等高危动作是否接人工确认?
🎉 恭喜!你已掌握 Gemini 3.5 Flash 内置 computer_use:单模型看界面+执行、Managed Agents 后台长任务、MCP 扩能力、Flex Tier 省成本。和本中心《Claude Computer Use》《腾讯 BrowserSkill》对照,能看清各家的「Agent 操作界面」路线差异。

常见问题速查

你遇到的现象大概率原因 & 解决
模型说「看不到界面」截图没喂入,检查运行环境截图链路
点了但没效果页面未在焦点 / 坐标偏移,重截一次
账单比预期高后台任务走 standard 了,改 flex
误触敏感信息开 block_sensitive_screenshot + 域名白名单
← 返回教程中心