能力评测 2026-09-30 20 分钟阅读 进阶

Assistant Analysis 横评:7 款数字助手「把事真办成」的实测账本

外部真值核验而非自报完成 — Claude Cowork 93.5% 领跑、Hermes 拿下 90% 可靠性、OpenClaw 77.4%,以及「分数」与「可靠」为何必须分开读

摘要

大多数 AI 助手榜单测的是「聊得像不像」,Anchor Browser 运营的 Assistant Analysis 基准测的是「事有没有真办成」:成功与否按独立采集的环境真值核验(邮件是否真的发出、预订是否真实存在),自报完成不作数。本文拆解其 v0.2.0 榜单(2026-09-17 评估,49/49 任务全覆盖)上 7 款系统的实测数据,分析分数与可靠性两个轴向的分裂,并讨论「拥有浏览器不等于拥有行动层」这一反直觉发现。榜单系厂商运营的早期公开板,立场与局限已在文中如实标注。

相关产品: OpenClaw Hermes Agent Manus

榜单是什么:外部真值与分离的轴

Assistant Analysis 由云浏览器基础设施厂商 Anchor Browser 团队发起,自称「独立的数字助手性能基准」。它与聊天竞技场的两点方法论差异值得注意:

旗舰指标 verified score 的定义是:被分配的任务中,达到预定成功结果、且没有触发取消资格的授权或安全违规的比例,并经独立真值核验确认。此外,只有方法学兼容的评估才会互相排名,评估不完整或不兼容的产品单独列出状态。

总榜:7 款系统的 verified 成绩单

v0.2.0 版本(评估日期 2026 年 9 月 17 日)上,7 个系统拥有 49/49 任务全覆盖的 verified 总分:

排名 系统 Verified 得分 可靠性 中位完成时间 形态与接入方式
1 Claude Cowork(Anthropic) 93.5% 86% 9.1s 经 API 接入,配通用 open-url 浏览工具
2 Muse(Meta) 89.0% 82% 55s Meta 个人 AI 助手,经浏览器聊天界面测试
3 Hermes(Nous Research) 86.9% 90% 24.8s 跑在本机的 CLI 助手,调用模型 API
4 Manus 85.7% 65% 159.2s 自带浏览器的云端智能体,经任务 API 接入
5 Instinct 79.3% 70% 78s 经 iMessage 交互
6 OpenClaw 77.4% 76% 41.8s 开源智能体,驱动真实浏览器、完全跑在用户本机
7 Grok Bot(xAI) 76.6% 73% 112.3s Grok 经频道 webhook 接入的自动化

榜单测的失败模式是落地页 demo 里看不见的那类:happy path 之后的登录墙、中途掉线的会话、任务编写时与实际执行时页面结构发生漂移。用主办方的话说,核心问题是「能不能在无人值守下穿越开放网络、能不能稳住会话、能不能在目标在脚下变动时恢复」。

分数与可靠性的分裂

把 verified 得分与可靠性两列单独对齐,能看到几个总分掩盖不了的现象:

系统 Verified 得分 可靠性 落差(得分 − 可靠性)
Hermes(Nous Research) 86.9% 90% −3.1pp
Claude Cowork(Anthropic) 93.5% 86% +7.5pp
Muse(Meta) 89.0% 82% +7.0pp
OpenClaw 77.4% 76% +1.4pp
Manus 85.7% 65% +20.7pp

三个观察:

架构观察:拥有浏览器不等于拥有行动层

主办方自己点出的一个结果值得单独讨论:OpenClaw 在这张榜单上架构上最接近真正的浏览器级访问——它驱动一个真实浏览器、完全运行在用户自己的机器上——但 verified 得分(77.4%)却低于 Claude Cowork 配一个通用的 open-url 浏览工具(93.5%)。

🧭 反直觉发现的含义

拥有浏览器本身并不充分,决定成绩的是行动执行层(action-taking layer):任务规划、错误恢复、会话保持与页面漂移下的重试策略。这一发现与 2026 年「harness 决定论」的评测趋势互相呼应——同底层能力、不同运行层,成绩可以差出一个身位。

当然,这个结论需要在厂商立场下审慎解读:Anchor Browser 本身就是浏览器基础设施供应商,强调「行动层而非浏览器所有权」的叙事与其商业位置天然契合。榜单数据本身可复核(方法学与开放数据在官网公开),但对结论的阐释应保留一份警惕。

与其他智能体榜单的口径对照

把 Assistant Analysis 放进 2026 年 9 月的智能体评测全景,可以看到它补的是「个人助理端到端办事」这个细分位。同期各独立榜单的领跑者(快照日期 9 月下旬,版本口径各异、不可互比):

基准 测什么 榜首与分数
Assistant Analysis v0.2.0 数字助手端到端把事办成(外部真值核验) Claude Cowork 93.5%
APEX-Agents v1.1 投行/咨询/法务跨应用职业任务 Claude Opus 5.5(max 档)73.5%
MCP-Atlas 真实 MCP 服务器上的工具调用 Muse Spark 1.1 88.1%
Toolathlon-Verified 600+ 工具大目录里的真实应用任务 GLM-5.3-Flash 78.4%
τ³-bench(银行域) 策略约束下的多轮工具调用 Qwen 3.8 Max 55.2%
Terminal-Bench 4.0 终端环境中的智能体作业 GPT-6 Astra 58.2%
OSWorld 2.0 长程 GUI 桌面任务 Claude Opus 5 77.67%(partial reward,v2.1)

对照的启示:不同榜单测的是不同能力的切面,96% 与 60% 的分差往往不反映强弱,而反映任务形态——职业任务、工具目录、终端作业、桌面 GUI、端到端助理各自有各自的难度天花板。任何跨榜排名都应视为无效信息。

局限与阅读建议

目前官方及行业暂未披露更多细节(如完整任务清单、置信区间数值与后续版本的评估排期),后续将持续跟进迭代动态。

核心发现

参考来源

  1. Anchor Browser 官方博客 — Most AI assistant leaderboards measure conversation. This one measures whether the work got done.(2026.09,含 v0.2.0 完整榜单)
  2. Assistant Analysis 官方站点 — assistantanalysis.com(方法学、兼容评估排名规则与开放数据)
  3. Fleece AI — AI Agent Benchmarks 2026 Explained(2026.09.24 更新,各独立榜单领跑者对照)
  4. OpenClaw 官方站点与仓库 — 产品架构背景(开源、本机运行、驱动真实浏览器)
  5. Nous Research — Hermes 产品资料(本地 CLI 助手形态背景)