榜单是什么:外部真值与分离的轴
Assistant Analysis 由云浏览器基础设施厂商 Anchor Browser 团队发起,自称「独立的数字助手性能基准」。它与聊天竞技场的两点方法论差异值得注意:
- 真值是外部的:成功与否对照「环境里实际发生了什么」核验——邮件是否真的送出、预订是否真实存在——而不是模型的自信程度或人类偏好投票。一个私有评估器记录环境快照、审计日志与真值检查,助手自报的完成情况永远不足以作为证据
- 轴与轴刻意分离:verified 得分(验证完成率)、可靠性、安全事件率、人工干预次数、中位完成时间、每成功任务成本分别追踪,不合成单一综合分。一个系统可以又快又不可靠,也可以安全但缓慢——主办方拒绝把它们平均掉
旗舰指标 verified score 的定义是:被分配的任务中,达到预定成功结果、且没有触发取消资格的授权或安全违规的比例,并经独立真值核验确认。此外,只有方法学兼容的评估才会互相排名,评估不完整或不兼容的产品单独列出状态。
总榜:7 款系统的 verified 成绩单
v0.2.0 版本(评估日期 2026 年 9 月 17 日)上,7 个系统拥有 49/49 任务全覆盖的 verified 总分:
| 排名 | 系统 | Verified 得分 | 可靠性 | 中位完成时间 | 形态与接入方式 |
|---|---|---|---|---|---|
| 1 | Claude Cowork(Anthropic) | 93.5% | 86% | 9.1s | 经 API 接入,配通用 open-url 浏览工具 |
| 2 | Muse(Meta) | 89.0% | 82% | 55s | Meta 个人 AI 助手,经浏览器聊天界面测试 |
| 3 | Hermes(Nous Research) | 86.9% | 90% | 24.8s | 跑在本机的 CLI 助手,调用模型 API |
| 4 | Manus | 85.7% | 65% | 159.2s | 自带浏览器的云端智能体,经任务 API 接入 |
| 5 | Instinct | 79.3% | 70% | 78s | 经 iMessage 交互 |
| 6 | OpenClaw | 77.4% | 76% | 41.8s | 开源智能体,驱动真实浏览器、完全跑在用户本机 |
| 7 | Grok Bot(xAI) | 76.6% | 73% | 112.3s | Grok 经频道 webhook 接入的自动化 |
榜单测的失败模式是落地页 demo 里看不见的那类:happy path 之后的登录墙、中途掉线的会话、任务编写时与实际执行时页面结构发生漂移。用主办方的话说,核心问题是「能不能在无人值守下穿越开放网络、能不能稳住会话、能不能在目标在脚下变动时恢复」。
分数与可靠性的分裂
把 verified 得分与可靠性两列单独对齐,能看到几个总分掩盖不了的现象:
| 系统 | Verified 得分 | 可靠性 | 落差(得分 − 可靠性) |
|---|---|---|---|
| Hermes(Nous Research) | 86.9% | 90% | −3.1pp |
| Claude Cowork(Anthropic) | 93.5% | 86% | +7.5pp |
| Muse(Meta) | 89.0% | 82% | +7.0pp |
| OpenClaw | 77.4% | 76% | +1.4pp |
| Manus | 85.7% | 65% | +20.7pp |
三个观察:
- Hermes 是「可靠冠军」而非「分数冠军」:90% 的可靠性全场最高,但 verified 得分低于 Cowork 与 Muse。分数与可靠性不在同一个轴上,这正是主办方把轴拆开的原因
- Manus 的 20.7 个百分点落差是全榜最大:能办成不少事(85.7%),但 65% 的可靠性意味着接近三分之一的运行存在波动,159.2 秒的中位完成时间也全场最长——能力强但不稳,对企业无人值守场景是另一番含义
- OpenClaw 两项指标几乎重合:得分与可靠性只差 1.4 个百分点,呈现「说到做到」的紧凑耦合,这对需要可预期行为的自动化流水线是有价值的性格特征
架构观察:拥有浏览器不等于拥有行动层
主办方自己点出的一个结果值得单独讨论:OpenClaw 在这张榜单上架构上最接近真正的浏览器级访问——它驱动一个真实浏览器、完全运行在用户自己的机器上——但 verified 得分(77.4%)却低于 Claude Cowork 配一个通用的 open-url 浏览工具(93.5%)。
拥有浏览器本身并不充分,决定成绩的是行动执行层(action-taking layer):任务规划、错误恢复、会话保持与页面漂移下的重试策略。这一发现与 2026 年「harness 决定论」的评测趋势互相呼应——同底层能力、不同运行层,成绩可以差出一个身位。
当然,这个结论需要在厂商立场下审慎解读:Anchor Browser 本身就是浏览器基础设施供应商,强调「行动层而非浏览器所有权」的叙事与其商业位置天然契合。榜单数据本身可复核(方法学与开放数据在官网公开),但对结论的阐释应保留一份警惕。
与其他智能体榜单的口径对照
把 Assistant Analysis 放进 2026 年 9 月的智能体评测全景,可以看到它补的是「个人助理端到端办事」这个细分位。同期各独立榜单的领跑者(快照日期 9 月下旬,版本口径各异、不可互比):
| 基准 | 测什么 | 榜首与分数 |
|---|---|---|
| Assistant Analysis v0.2.0 | 数字助手端到端把事办成(外部真值核验) | Claude Cowork 93.5% |
| APEX-Agents v1.1 | 投行/咨询/法务跨应用职业任务 | Claude Opus 5.5(max 档)73.5% |
| MCP-Atlas | 真实 MCP 服务器上的工具调用 | Muse Spark 1.1 88.1% |
| Toolathlon-Verified | 600+ 工具大目录里的真实应用任务 | GLM-5.3-Flash 78.4% |
| τ³-bench(银行域) | 策略约束下的多轮工具调用 | Qwen 3.8 Max 55.2% |
| Terminal-Bench 4.0 | 终端环境中的智能体作业 | GPT-6 Astra 58.2% |
| OSWorld 2.0 | 长程 GUI 桌面任务 | Claude Opus 5 77.67%(partial reward,v2.1) |
对照的启示:不同榜单测的是不同能力的切面,96% 与 60% 的分差往往不反映强弱,而反映任务形态——职业任务、工具目录、终端作业、桌面 GUI、端到端助理各自有各自的难度天花板。任何跨榜排名都应视为无效信息。
局限与阅读建议
- 厂商运营的早期公开板:榜单由 Anchor Browser 运营,主办方承认这是早期公开板、若干行的置信区间较宽、每成功任务成本一栏尚未填充、排名将随新系统与新版本提交而变动
- 利益相关声明:Anchor Browser 的主业是智能体浏览器基础设施,评测框架凸显的「会话、MFA 存活、页面漂移恢复」恰是其商业能力所在;数据可复核,但叙事需打折
- 任务集与评估规程的公开程度:主办方声称方法学、兼容评估排名规则与开放数据在官网(assistantanalysis.com)公开,但独立第三方复测结果尚未见诸公开渠道
- 7 个系统的覆盖不代表全市场:ChatGPT 类助手的官方 agent 产品、Gemini 生态的助手等未出现在当前榜上,排名完整性有限
- 中位完成时间的口径:不同系统经不同通道接入(API/聊天/webhook/iMessage),耗时数字反映的是「通道+系统」的复合表现,不能单独归因于模型或产品
目前官方及行业暂未披露更多细节(如完整任务清单、置信区间数值与后续版本的评估排期),后续将持续跟进迭代动态。