为什么重置:旧 OSWorld 的饱和与 86% 的开源分数
OSWorld 是评估智能体操控真实 Ubuntu 桌面(文件、浏览器、办公套件、系统设置)的代表性基准,其作者团队测得的人类基线为 72.36%。到 2026 年年中,旧版基准的格局已经失控——第三方跨基准索引与官方 OSWorld-Verified 榜单显示,阿里 Qwen3.8-Max 以 86.1% 登顶、Claude 系模型紧随其后在 85% 上下,开源与闭源模型双双越过人类基线。
问题不在于模型变神了,而在于基准「漏气」了。维护方 XLANG 实验室在 OSWorld-V2 发布材料中的表述相当坦率:智能体在旧版跑到 83.5% 以上,并不意味着问题解决,而是基准不再测量问题本身。旧版任务平均只需约 30 次工具调用,属于「改个壁纸、存个文件」级别的短程操作;配合 Verified 版修复 300 多个损坏任务环境后提供的稳定靶子、以真实 GUI 交互为主的强化学习训练配方、以及 50 倍并行评测压缩的迭代周期,三股力量叠加把分数在一年多时间里推过了人类线。
从 OSWorld 2.0 的观察看,一个新智能体基准在被大厂盯上之后的有效信息寿命约为十周——发布时 20.6% 的完成率天花板,十周内被抬到 77.9%。选型时引用任何基准分数,先核对分数与模型发布的相对时间。
OSWorld 2.0 长什么样:108 个任务与 318 次工具调用
OSWorld 2.0(论文编号 arXiv 2606.29537,2026 年 6 月底发布)的核心设定:
- 108 个长程工作流:覆盖办公生产力、数据处理、专业创意工具与系统管理等七个职业域,任务取材真实输入工件,并与带状态的用户档案数据交叉引用。
- 中位 1.6 小时的人类完成时间:这是与旧版最本质的差别——任务是「跨三个应用核对数据、产出报告、并顺手修好中途出错的地方」,而非单点操作。
- 平均 318 次工具调用:以 Claude Opus 4.7 最大思考预算实测,对照旧版的约 30 次,任务长度放大了一个数量级。
- 二元完成计分:主指标在 500 步预算下按任务是否端到端完成判定,另设部分完成(partial)口径;官方同时发布安全审计报告,审计安全敏感操作的执行过程。
发布基线同样值得一提:官方作者实测中,Claude Opus 4.8(最大思考 + 批量工具调用)在 500 步预算下也只完成 20.6%(partial 54.8%),GPT-5.5 更省 token 但停滞在 13% 左右且对步数预算不敏感。论文的结论句写得清醒:当代智能体在专业级计算机操控上仍有相当距离——它们不是倒在基础 GUI 控制上,而是丢失约束跟踪、漏掉任务中途到达的信息、该问用户时靠猜、以及跳过验证。
榜单全景:77.9% 的头部与 52.3% 的开源尾巴
截至 2026 年 9 月下旬,OSWorld 2.0 榜单(聚合自 llm-stats、Steel.dev 等第三方索引,原始分数均为各厂商自报)的头部格局如下:
| 模型 / 系统 | 厂商 | 自报分数(partial 口径) | 口径备注 |
|---|---|---|---|
| Claude Fable 5.1 | Anthropic | 77.9% | 1080p、500 步、Opus 4.8 评分器;卡片自述修改了任务与评分 |
| GPT-6 Astra | OpenAI | 72.6% | 2026.08.08 离线子集,约 40 分钟/任务的延迟模拟 |
| Claude Opus 5 | Anthropic | 70.6% | 五次运行首次尝试均值;OpenAI 复测表列 70.2% |
| Muse Spark 1.3 | Meta | 66.9% | 最大推理档、自家 GUI 操控 harness、完整 Ubuntu VM |
| GPT-5.6 Sol | OpenAI | 62.6%(离线子集 65.7%) | 发布时自报;离线子集为另一口径 |
| Claude Opus 4.8 | Anthropic | 54.8%(官方设置实测) | binary 完成率 20.6%——发布基线 |
| Qwen3.8-Flash-Next | Alibaba | 52.3% | partial 口径;binary 为 19.4% |
| GPT-5.5 | OpenAI | 49.5% | binary 13.0%,在 150/300/500 步下持平 |
两个结构性观察:其一,头部在十周内从 20.6% 抬到 77.9%,抬升主力是推理预算(最大思考)、工具批量调用与评分口径调整的组合,而非某个单点技术突破;其二,开源阵营(Qwen3.8-Flash-Next 52.3%)在 2.0 上暂时没有复现旧版反超闭源的剧本——长程任务对推理预算与上下文工程的要求,放大了头部闭源模型的优势。
口径拆解:partial、binary、自报与独立复测
这张榜单最容易误读的地方在口径。评测机构 Snorkel AI(本身是基准共建方)在 9 月做了独立复测,结果与厂商自报的差异值得逐行对照:
| 系统 | 厂商自报 | Snorkel 独立复测(partial) | Snorkel 复测(binary) | 差异要点 |
|---|---|---|---|---|
| Claude Opus 5 | 70.6% | 68.31% | 31.43% | partial 与 binary 相差约 37 分:大量任务「做了一部分」 |
| GPT-5.6 Sol | 62.6%–65.7% | 62.72% | 27.34% | 自报与复测 partial 接近,但 binary 同样腰斩以上 |
三句话读懂这张表:partial 分数给中间进度记分,binary 分数只认端到端完成——同一模型的两种口径可以差 30 到 40 分,媒体报道若不标注口径,横评结论可以直接反转;自报与第三方复测的 partial 差距不大(2 分上下),说明厂商没有大规模虚报,但每家的运行配置(分辨率、步数预算、评分器版本、是否修改任务)各不相同,横向可比性依然有限——连 Anthropic 自家的 Fable 5.1 卡片都注明「修改了任务与评分设置,不可与官方设置行直接对比」;真正反映「能交付」的指标是 binary,而它说明头部模型离「十件长程任务稳成七件」还有一段真实的距离。
四类失败模式:智能体到底输在哪里
官方论文对任务难点做过结构化统计,四类现象在任务中的占比为:
- 跨源推理(cross-source reasoning):42.6% 的任务需要把分散在多个应用/数据源的信息拼合判断。
- 视觉空间精度(visual-spatial precision):41.7% 的任务要求精确的界面定位与操作。
- 隐式状态推断(implicit-state inference):39.8% 的任务要求从界面残留状态推断「之前发生了什么」。
- 多物品状态跟踪:39.8% 的任务需要同时跟踪多个对象的最新状态。
论文点名的最具破坏性的单一失败模式,是隐藏状态的恢复与维护——人类在两小时工作流里靠脑子记住的那本账(哪一步其实失败了、哪个文件改过名、哪条约束不能碰),正是当代智能体最薄弱的环节。这与本站此前对智能体记忆架构与长程可靠性评测的观察一致:GUI 操作的「手」已经够用了,长程任务的「记性」才是瓶颈。对落地团队的启示是直接的:在真实业务中部署计算机操控智能体,检查点持久化、中途失败重验、以及「不确定就问人」的升级机制,比再堆一档推理预算更能提升端到端完成率。
成本维度:同一分数背后的价差
第三方定价索引对 OSWorld 2.0 各模型的单任务成本估算,揭示了另一条选型曲线:
| 模型 | 分数(口径如前) | 估算成本量级(第三方口径) |
|---|---|---|
| Claude Fable 5.1 | 77.9% | 约 60 美元/任务档 |
| Claude Opus 5 | 70.6% | 约 30 美元/任务档 |
| Muse Spark 1.3 | 66.9% | 约 5.5 美元/任务档 |
| GPT-5.6 Luna | 45.6% | 约 1.4 美元/任务档 |
| Qwen3.8-Flash-Next(开源) | 52.3% / 19.4% | 约 0.6 美元/任务档 |
需要注意这是第三方按公开 token 价格的估算,实际成本受推理档位、步数预算与重试策略影响很大(官方作者实测 GPT-5.5 一次 500 步全量运行就花了约 2750 美元)。但量级结论稳健:头部分数与成本大致同向增长,而 65% 到 70% 分数段存在明显的高性价比位——对容错率中等的场景,「够用档」模型加严格的流程校验,往往比顶格预算更理性。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
辩证结论:十周保质期与选型建议
OSWorld 2.0 提供的十个观察周期能沉淀下三条相对耐用的判断:
- 分数会过期,口径不会:引用任何分数先问三件事——partial 还是 binary、谁跑的(自报还是第三方)、什么配置(分辨率/步数/评分器)。这三问足够过滤掉市场上大半的误导性横评。
- 长程任务的真瓶颈是状态维护:42.6% 的跨源推理与隐藏状态恢复失败指向同一个工程短板。选型时应重点考察候选系统在检查点、中断恢复与失败重验上的能力,而非只看榜首分数。
- 基准重置的节奏在加快:旧版用了约一年走向饱和,2.0 只用了十周就被推到 77.9%。对使用方而言,与其追逐榜单排名,不如建立自己的留出任务集——用真实业务工作流测端到端完成率,这是不会被「基准保质期」作废的分数。