2026 年 6 月 24 日,Google 把 computer use(计算机操作)作为 Gemini 3.5 Flash 的内置工具正式发布。过去这需要单独的预览模型,现在一次 google/gemini-3.5-flash 调用就能完成:看截图、推理 UI 元素、在浏览器 / 桌面 / 移动端执行操作。与之同来的还有 Managed Agents 后台执行、远程 MCP 集成,以及 Interactions API 正式版(Flex Tier 便宜约 50%,约 2 分钟延迟 SLA)。本教程带你把这套 Gemini 浏览器智能体跑起来。
先搞懂:内置 computer_use 变了什么
用一句话理解:以前「看界面 + 想 + 动手」是三个模型接力,现在是同一个 Gemini 3.5 Flash 一次搞定。变化很关键:
| 维度 | 旧方案 | 内置 computer_use |
|---|---|---|
| 模型 | 主模型 + 单独预览模型 | 单一 gemini-3.5-flash |
| 调用 | 多次往返 | 一次调用看截图并执行 |
| 环境 | 多为浏览器 | 浏览器 / 桌面 / 移动端 |
一次调用省的是架构复杂度,不是魔法。它依然会截屏、推理、产出动作序列,只是这些现在由同一模型连贯完成,工程上简单很多。
Step 1:拿到 Key 并启用工具
1. 去 Google AI Studio(或 Vertex AI)创建 API Key
2. 在请求里启用内置工具 computer_use_google
3. 设好环境变量:
export GEMINI_API_KEY="AIza-xxxxxxxx"
Step 2:跑通第一个 computer_use 调用
import google.generativeai as genai
genai.configure(api_key=GEMINI_API_KEY)
# 启用内置 computer_use 工具
model = genai.GenerativeModel(
"gemini-3.5-flash",
tools=[{"name": "computer_use_google"}],
)
resp = model.generate_content(
"打开 example.com,找到搜索框,搜 AI news,告诉我第一条标题"
)
print(resp.text)
首次运行要给模型「眼睛」。computer_use 依赖页面截图作为输入,确保你的运行环境能把当前界面截图喂给模型(本地用截图工具,云端用托管浏览器)。
Step 3:用 Managed Agents 跑后台长任务
有些任务要跑几分钟甚至更久,Managed Agents 让你派出去后先去忙别的:
# 示意:把长任务交给后台 Managed Agent
agent = client.managed_agents.create(
model="gemini-3.5-flash",
task="每隔 10 分钟查一次竞品价格,有变动就记下来,跑 1 小时",
)
# 之后轮询结果,不必阻塞等待
result = client.managed_agents.get(agent.id)
Step 4:接远程 MCP 服务器扩展能力
# 把远程 MCP 服务器挂给 Agent,扩展它能调的工具
model = genai.GenerativeModel(
"gemini-3.5-flash",
tools=[
{"name": "computer_use_google"},
{"mcp_server": "https://your-mcp.example.com/sse"},
],
)
# 现在它能边看界面,边查数据库 / 调内部 API
MCP 是能力倍增器。computer_use 解决「操作界面」,MCP 解决「调用后端系统」,两者一组合,智能体才是完整的数字员工,而不只是个会点按钮的脚本。
Step 5:用 Interactions API + Flex Tier 路由
# Interactions API 正式版支持 Flex Tier:便宜约 50%,约 2 分钟延迟 SLA
# 适合不要求秒回的后台交互任务
client.interactions.run(
model="gemini-3.5-flash",
tier="flex", # flex / standard
prompt="整理这份周报草稿,半小时内回我就行",
)
Step 6:安全防护:截图与权限
# 护栏建议
{
"block_sensitive_screenshot": true, // 含密码/卡号区域不打给模型
"allow_domains": ["example.com"], // 只允许操作白名单站点
"confirm_high_risk": true // 提交/支付等动作人工确认
}
截图可能含敏感信息。computer_use 的「眼睛」会看到屏幕上一切,务必屏蔽敏感区域、限制可操作域名,并把高危动作接人工确认。
Step 7:落地检查清单
□ computer_use_google 工具是否启用、截图能否喂入?
□ 长任务是否交给 Managed Agents 后台跑?
□ 是否通过 MCP 接了必要的后端工具?
□ 后台批量是否走 Flex Tier 省成本?
□ 敏感截图是否屏蔽、域名是否白名单?
□ 提交/支付等高危动作是否接人工确认?
常见问题速查
| 你遇到的现象 | 大概率原因 & 解决 |
|---|---|
| 模型说「看不到界面」 | 截图没喂入,检查运行环境截图链路 |
| 点了但没效果 | 页面未在焦点 / 坐标偏移,重截一次 |
| 账单比预期高 | 后台任务走 standard 了,改 flex |
| 误触敏感信息 | 开 block_sensitive_screenshot + 域名白名单 |