一句话:Computer Use 没消失,只是躲进了你已经在用的产品里
9 月 24 日,一份题为《The State of Computer Use》的梳理把过去一年这个方向的变化讲得很透:Computer Use(让智能体像人一样看屏幕、点鼠标、敲键盘去操作没有 API 的软件)并没有退潮,但它的形态从「独立 App」塌成了「常用产品的内置功能」。OpenAI 的 Operator、Google 的 Project Mariner、ChatGPT Atlas 都在近一年里作为独立入口退役,能力分别并回 ChatGPT、Chrome 与 Codex;开源底座 Cua 则把「一台电脑」本身做成可被 Agent 调度的资源。能直接操作的界面,正在变成分发渠道的附赠。
为什么值得看:基准涨了,生产却仍挑活干
Computer Use 的基准数字这两年爬得猛。OSWorld 这类全桌面任务,早期模型还在十几分徘徊,到 2026 年头部已破人类基线——9 月榜单上 Qwen3.8-Max 达 86.1%、Anthropic 的 Claude Mythos 系列紧随其后、GPT-5.4 约 75.0%。但同一份梳理也泼了冷水:这些分数大多跑在友好、可预测、没登录没弹窗的网站上;换到 WebArena 这种带真实脏活的场景,强模型也就 High 50 多分,而人类基线近 78。更硬的指标 Cua Bench 用真实 KiCad 电路设计任务考,头部前沿 Agent 目前 25 题只过 6 题。结论不是「不能用」,而是「基准是天花板,不是承诺」——生产屏比基准乱得多。
机制拆解:只在「机器能核验结果」的地方省事
这份梳理里最有价值的一句话,来自一线数据平台的反馈:有团队每月靠 Agent 跑 1500 到 2000 万次门户交互,把它当「手写爬虫坏了之后的自愈兜底」。这恰好点出 Computer Use 的真实定位——它最值钱的地方,是替那些根本没 API 的 legacy portal、供应商系统、政府网站干活,且因为是从界面操作、随应用漂移的概率比集成低。反过来,它最不擅长的是「结果难核验」的任务:Agent 提交一份保险索赔,看到「已收到」就走,两三天后电话打来才发现单号填错。作者给出的经验法则很朴素——只在机器能检查结果对不对的地方,它才真省事。能验证,才敢放手。
实验读数:成本与速度,是绕不开的两道坎
把生产现实摊开,至少有三道坎。其一,慢:一个真人两三分种做完的任务,Agent 要 8 到 10 分种,因为它一步步截图、推理、动作。其二,贵:a16z 的粗估是每 agent 小时 6 到 8 美元,长程桌面对账任务若每步都传 1.5MB 截图给视觉模型,单次执行可能烧掉 10 到 30 美元。其三,不可控:登录、验证码、支付屏是常见卡点,稳的产品会在这些点主动把控制权交回人。所以行业里浮现出一种混合范式——凡有 API、CLI、数据库的地方一律用类型化工具,只在没集成路由的步骤才让 Computer Use 上;买东西、传数据、删东西、签协议这类后果不可逆的动作,一律路由给人。这比「要么全自动、要么不用」务实得多。
优势与局限:能力到位了,工程没到位
Computer Use 的长处是触达面广——只要人能点的界面它就能碰,不必等厂商开放接口,先出结果也快。局限同样实在:其一,它比脚本化 RPA 慢且不可预测,高频、稳定、已有集成的任务仍该用传统自动化;其二,截图会把页面上的注入指令一并读进来,提示注入的攻击面比结构化 API 大;其三,审计上截图与动作日志不如结构化请求响应好对账,合规敏感场景要谨慎。关于在海量并发、强一致事务下的成熟部署范式,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。它眼下的位置很清晰:不是替代集成,而是补上集成的空白。
结语
Computer Use 这一年的转折,不在能力、在形态:用户不想再开一个专门让它点屏幕的 App,他们要的是 ChatGPT、Chrome、Codex 里顺手多出来的一只手。当能力退进常用产品、成本与验证两道坎又被混合范式慢慢压住,Computer Use 才真正从 demo 走向「偶尔真能干活的兜底」。对甲方来说,别问「要不要上 Computer Use」,该问「哪块没 API 的脏活,值得让它先试」。