一句话:给智能体造一个浏览器,让它少读点页面、少烧点 token
2026 年 9 月 22 日,Aloha 发布 Agent 优先浏览器 AlohaJet。它和普通浏览器的区别在于:后者是人用的,前者是模型用的。内置的 LLMdex 引擎把页面上「该看哪块、下一步做什么」直接指给模型,而不是让模型每走一步都重新解读整页原始数据或截图。按厂商自家基准,同样六类常见网页任务,AlohaJet 的 token 用量减少 54%,速度快 2.2 倍,任务成功率 88%,而标准 Chrome 自动化只有 51%,Playwright 只有 11%。
为什么值得看:网页智能体的账本藏在重读页面里
网页智能体这两年很热,可真正跑起来的人都懂一个痛点:成本。一次网页任务消耗的 token,往往是一个普通对话的上千倍,因为模型每完成一步,都可能要重新评估整页发生了什么。更糟的是网站改版会让写死的指令失效,可靠性跟着崩。AlohaJet 的切入点正是这块浪费——它要解决的不是让模型更聪明,而是让模型别在「看清页面」这件事上反复花冤枉钱。创始人 Andrew Frost 的说法很直白:单次任务花几美元容易被忽略,可同一个任务跑一万次,就是一笔真实的基础设施账单。这个视角,恰好踩中企业把智能体铺量时最敏感的那根神经。
机制拆解:LLMdex 把定位与路由一次做完
LLMdex 的核心是把两步合并:一是把模型指到页面上相关的那块区域与下一个动作,二是把常规步骤分派给对的模型。接入多个模型时,它用一套阶梯式路由,把大多数简单步骤交给体积小、成本低的模型,只在复杂步骤才调用能力更强的大模型,从而把昂贵的算力集中在真正需要的地方。对重复出现的工作流,它还能复用已经学过的路线,而不是依赖写死的指令——网站改版时旧指令会过时,可学到的路线能跟着布局调整。对开发者而言,迁移成本低到只改一行 base URL:任何说 OpenAI 聊天补全格式的智能体都能接上。
收益读数:亮眼,但出自自家基准
必须强调,那些漂亮数字都来自 Aloha 自己的基准,且成本与速度两项其实对照了不同的对手,属于「开局结论」而非「定论」。即便如此,方向是清楚的:在六个常见任务(搜索、填表、抽取、跨页导航等)上,AlohaJet 自称把 token 砍掉 54%、提速 2.2 倍,把成功率从 Chrome 的 51% 拉到 88%。它支持有头与无头两种模式,既能让人盯着中途接管,也能从命令行或 MCP 驱动;桌面端先上 macOS,Linux 在路上,企业版可在客户虚拟私有云、本地或完全离网环境部署,AWS 与 Nebius 被列为合作方。免费档覆盖完整浏览器、命令行、MCP 服务器与自有密钥,Pro 与 Ultra 两档定价已出但功能清单尚未补全。
优势与局限:省钱叙事清晰,验证仍需第三方
优势在问题定义准:把网页智能体最贵的「反复看清页面」环节压缩掉,并用模型路由把成本压向小模型。局限在于:其一,所有关键数字都来自厂商自家基准,缺乏独立复现,对照对象也不统一;其二,当前桌面端仅 macOS 完整,平台覆盖有限;其三,关于在真实企业长尾网站、反爬与登录墙场景下的稳定性,官方及行业暂未披露更多细节,后续将持续跟进迭代动态。它在「省 token」上的主张是否成立,终究要等第三方基准来拍板。
结语
AlohaJet 把网页智能体的成本问题摆到了产品层面:不是更聪明的模型,而是更会省着用的浏览器。它给出的 54% 与 2.2 倍是否经得起复现另说,但「为智能体造浏览器」这个方向,已经被它点得很亮。