浏览器这个老古董,被重新切成 Agent 的跑腿

在今年的云栖大会上,阿里云和英特尔联手端出了一套叫 Agentic Browser 的东西。说人话,就是把给真人用的 Chromium 浏览器,改造成适合智能体大规模并发跑的云端执行引擎。阿里云终端智能计算的产品专家蒋佳忆抛出一个挺扎心的背景:今年机器流量已经超过了人类流量,而这些新用户上网不是为了看内容,是为了比价、填表、下单,要把一件件具体的工作做完。可今天的浏览器是为人设计的,智能体一碰到登录、验证码和复杂交互页面就容易栽跟头,任务也就黄了。

用户变了:机器流量已经超过人类流量传统浏览器(为人设计)渲染要漂亮、单实例重、并发弱遇登录/验证码/复杂交互易失败改造 Chromium(Blink/V8 裁剪调优)预编译 SDK 交付,面向 Agent 场景只保留任务需要的执行载体阿里云弹性基础设施:按需拉起/释放,高并发浏览器集群单实例内存最多降约 30%(数百上千实例并发时直接改密度与成本)英特尔至强 AVX-512 / IAA / QAT 提供计算、压缩与数据处理加速
图|阿里云与英特尔把 Chromium 拆成更适合 Agent 并发运行的云端执行引擎:单实例内存最多降约三成,机器流量首超人类是这个改造的背景。

所以两边的改法很直接:在官方 Chromium 主干上,对 Blink 渲染引擎和 V8 JavaScript 引擎做面向 Agent 场景的裁剪和调优,再以预编译 SDK 的方式交付,跑在阿里云的弹性基础设施上,支持高并发的浏览器集群。英特尔那头用至强处理器上的 AVX-512、IAA、QAT 这类硬件能力,给相关计算、压缩和数据处理做加速。蒋佳忆给出的口径是,面向 Agent 优化之后,单实例内存开销最多可以降低大约三成。单个浏览器省下的资源看着有限,可一旦几百上千个实例同时跑,直接决定整个 Agent 集群能塞下多少、花多少钱。

成本真正烧在哪,比渲染重要得多

传统 Browser Agent 干活时,往往在不停地规划、推理、观察页面,再决定下一步怎么动,token 和算力就这么一遍遍烧。阿里云的说法是,经过这轮优化,单任务成本能直降百倍量级——但这属于厂商自述,具体能落到多少还得看真实业务压测,不能照单全收。更关键的是思路变了:页面漂不漂亮已经不重要,Agent 只关心任务能不能做成、执行顺不顺、成本够不够低,能不能给它用才是硬指标。

成本不在渲染,在循环传统 Browser Agent反复 Planning/推理/观察页面再决定token 与算力一遍遍烧优化后(厂商口径)单任务成本直降百倍量级Agent 只关心做成/顺/便宜新用户上网不为看内容,是为比价/填表/下单完成一项项工作
图|浏览器 Agent 的成本主要来自反复「看页面—推理—再动作」的循环;阿里云给出的口径是单任务成本直降百倍量级,但这是厂商自述,需以实测为准。

把浏览器当成智能体的运行时来重新设计,其实把过去绕不开的 Web 标准都接住了——动态页面、复杂 JavaScript、会话保持和各种自动化框架,本就建立在 Chromium 代表的规范之上。与其另起炉灶造一套 Agent 专属的网页协议,不如在兼容性上做减法。对做浏览器 Agent 的团队来说,这相当于有人把最重的底层活儿先干了:你不用再为每个网站手搓适配,直接拿 SDK 在高并发集群上跑任务。当然,内存降三成、成本降百倍这些数字都还是发布口径,真要上生产,密度、稳定性和长任务的可恢复性,才是决定它能不能替代自建方案的那道关。