能力评测 2026-09-22 26 分钟阅读 通用

OSWorld 2.0 横评:108 个长程桌面任务重置了计算机操控智能体排行

发布十周,最高分从 20.6% 涨到 77.9% — 但「partial 分数」与「binary 分数」之间,藏着一道大多数人没读懂的口径鸿沟

摘要

当旧版 OSWorld 上开源模型跑到 86%、超过 72.36% 的人类基线时,维护方 XLANG 实验室说了一句罕见的老实话:分数到这个位置,说明的不是问题被解决了,而是基准停止了测量。2026 年 6 月底发布的 OSWorld 2.0 用 108 个中位耗时 1.6 小时、平均 318 次工具调用的真实桌面工作流重新校准了这条赛道——发布时头部模型仅完成 20.6% 的任务,十周后 Claude Fable 5.1 的自报分数已到 77.9%。本文基于官方榜单、arXiv 论文与第三方评测索引,拆解这轮「重置—暴涨」背后的三套口径(partial/binary、自报/独立复测、离线子集/全量),并分析官方论文给出的四类失败模式:真正卡住智能体的不是点击精度,而是跨两小时工作流的隐藏状态维护。

为什么重置:旧 OSWorld 的饱和与 86% 的开源分数

OSWorld 是评估智能体操控真实 Ubuntu 桌面(文件、浏览器、办公套件、系统设置)的代表性基准,其作者团队测得的人类基线为 72.36%。到 2026 年年中,旧版基准的格局已经失控——第三方跨基准索引与官方 OSWorld-Verified 榜单显示,阿里 Qwen3.8-Max 以 86.1% 登顶、Claude 系模型紧随其后在 85% 上下,开源与闭源模型双双越过人类基线。

问题不在于模型变神了,而在于基准「漏气」了。维护方 XLANG 实验室在 OSWorld-V2 发布材料中的表述相当坦率:智能体在旧版跑到 83.5% 以上,并不意味着问题解决,而是基准不再测量问题本身。旧版任务平均只需约 30 次工具调用,属于「改个壁纸、存个文件」级别的短程操作;配合 Verified 版修复 300 多个损坏任务环境后提供的稳定靶子、以真实 GUI 交互为主的强化学习训练配方、以及 50 倍并行评测压缩的迭代周期,三股力量叠加把分数在一年多时间里推过了人类线。

📊 一个可记的经验数字

从 OSWorld 2.0 的观察看,一个新智能体基准在被大厂盯上之后的有效信息寿命约为十周——发布时 20.6% 的完成率天花板,十周内被抬到 77.9%。选型时引用任何基准分数,先核对分数与模型发布的相对时间。

OSWorld 2.0 长什么样:108 个任务与 318 次工具调用

OSWorld 2.0(论文编号 arXiv 2606.29537,2026 年 6 月底发布)的核心设定:

发布基线同样值得一提:官方作者实测中,Claude Opus 4.8(最大思考 + 批量工具调用)在 500 步预算下也只完成 20.6%(partial 54.8%),GPT-5.5 更省 token 但停滞在 13% 左右且对步数预算不敏感。论文的结论句写得清醒:当代智能体在专业级计算机操控上仍有相当距离——它们不是倒在基础 GUI 控制上,而是丢失约束跟踪、漏掉任务中途到达的信息、该问用户时靠猜、以及跳过验证。

榜单全景:77.9% 的头部与 52.3% 的开源尾巴

截至 2026 年 9 月下旬,OSWorld 2.0 榜单(聚合自 llm-stats、Steel.dev 等第三方索引,原始分数均为各厂商自报)的头部格局如下:

模型 / 系统 厂商 自报分数(partial 口径) 口径备注
Claude Fable 5.1 Anthropic 77.9% 1080p、500 步、Opus 4.8 评分器;卡片自述修改了任务与评分
GPT-6 Astra OpenAI 72.6% 2026.08.08 离线子集,约 40 分钟/任务的延迟模拟
Claude Opus 5 Anthropic 70.6% 五次运行首次尝试均值;OpenAI 复测表列 70.2%
Muse Spark 1.3 Meta 66.9% 最大推理档、自家 GUI 操控 harness、完整 Ubuntu VM
GPT-5.6 Sol OpenAI 62.6%(离线子集 65.7%) 发布时自报;离线子集为另一口径
Claude Opus 4.8 Anthropic 54.8%(官方设置实测) binary 完成率 20.6%——发布基线
Qwen3.8-Flash-Next Alibaba 52.3% partial 口径;binary 为 19.4%
GPT-5.5 OpenAI 49.5% binary 13.0%,在 150/300/500 步下持平

两个结构性观察:其一,头部在十周内从 20.6% 抬到 77.9%,抬升主力是推理预算(最大思考)、工具批量调用与评分口径调整的组合,而非某个单点技术突破;其二,开源阵营(Qwen3.8-Flash-Next 52.3%)在 2.0 上暂时没有复现旧版反超闭源的剧本——长程任务对推理预算与上下文工程的要求,放大了头部闭源模型的优势。

口径拆解:partial、binary、自报与独立复测

这张榜单最容易误读的地方在口径。评测机构 Snorkel AI(本身是基准共建方)在 9 月做了独立复测,结果与厂商自报的差异值得逐行对照:

系统 厂商自报 Snorkel 独立复测(partial) Snorkel 复测(binary) 差异要点
Claude Opus 5 70.6% 68.31% 31.43% partial 与 binary 相差约 37 分:大量任务「做了一部分」
GPT-5.6 Sol 62.6%–65.7% 62.72% 27.34% 自报与复测 partial 接近,但 binary 同样腰斩以上

三句话读懂这张表:partial 分数给中间进度记分,binary 分数只认端到端完成——同一模型的两种口径可以差 30 到 40 分,媒体报道若不标注口径,横评结论可以直接反转;自报与第三方复测的 partial 差距不大(2 分上下),说明厂商没有大规模虚报,但每家的运行配置(分辨率、步数预算、评分器版本、是否修改任务)各不相同,横向可比性依然有限——连 Anthropic 自家的 Fable 5.1 卡片都注明「修改了任务与评分设置,不可与官方设置行直接对比」;真正反映「能交付」的指标是 binary,而它说明头部模型离「十件长程任务稳成七件」还有一段真实的距离。

四类失败模式:智能体到底输在哪里

官方论文对任务难点做过结构化统计,四类现象在任务中的占比为:

论文点名的最具破坏性的单一失败模式,是隐藏状态的恢复与维护——人类在两小时工作流里靠脑子记住的那本账(哪一步其实失败了、哪个文件改过名、哪条约束不能碰),正是当代智能体最薄弱的环节。这与本站此前对智能体记忆架构与长程可靠性评测的观察一致:GUI 操作的「手」已经够用了,长程任务的「记性」才是瓶颈。对落地团队的启示是直接的:在真实业务中部署计算机操控智能体,检查点持久化、中途失败重验、以及「不确定就问人」的升级机制,比再堆一档推理预算更能提升端到端完成率。

成本维度:同一分数背后的价差

第三方定价索引对 OSWorld 2.0 各模型的单任务成本估算,揭示了另一条选型曲线:

模型 分数(口径如前) 估算成本量级(第三方口径)
Claude Fable 5.1 77.9% 约 60 美元/任务档
Claude Opus 5 70.6% 约 30 美元/任务档
Muse Spark 1.3 66.9% 约 5.5 美元/任务档
GPT-5.6 Luna 45.6% 约 1.4 美元/任务档
Qwen3.8-Flash-Next(开源) 52.3% / 19.4% 约 0.6 美元/任务档

需要注意这是第三方按公开 token 价格的估算,实际成本受推理档位、步数预算与重试策略影响很大(官方作者实测 GPT-5.5 一次 500 步全量运行就花了约 2750 美元)。但量级结论稳健:头部分数与成本大致同向增长,而 65% 到 70% 分数段存在明显的高性价比位——对容错率中等的场景,「够用档」模型加严格的流程校验,往往比顶格预算更理性。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

辩证结论:十周保质期与选型建议

OSWorld 2.0 提供的十个观察周期能沉淀下三条相对耐用的判断:

核心发现

参考来源

  1. OSWorld 官方榜单与 XLANG 实验室发布材料(os-world.github.io / osworld-v2.xlang.ai,2026)
  2. arXiv 2606.29537 — OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks(2026.06.28)
  3. Steel.dev — AI Agent Benchmark Results 与 OSWorld 2.0 Leaderboard(354 条结果索引,2026.09 快照)
  4. llm-stats.com — OSWorld 2.0 基准页(11 个模型分数汇总,2026.09)
  5. o-mega.ai — AI Computer Use Benchmarks 2026 Guide(2025–2026 分数沿革与饱和机制分析)
  6. AnotherWrapper — OSWorld 2.0 Leaderboard 含成本估算(2026.09.21 快照,第三方口径)