总分很高,全对很少,这中间差了什么

9 月 21 日前后有两篇计算机使用智能体(Computer Use Agent)方向的论文前后脚放出,放在一起读刚好构成一枚硬币的两面。头一篇叫 RecreationWorld(arXiv 2609.22000),它做的事听起来朴素:给智能体一个正在运行的应用程序当参考答案,让它在没有预设工作流的前提下自己摸索行为逻辑,然后从零实现一个自己的版本。跨 Ubuntu、macOS、Windows、Android 和 Web 五个平台,一共 250 个任务。

评分设计是这篇论文真正值钱的地方。参考应用会被实际执行,用来生成隐藏的行为测试——界面长什么样、点下去发生什么、计算结果对不对,都由运行中的参考程序说了算,答案卷不由人手写。每条测试先在参考应用上验证、再经人工复核,然后整套题才冻结。这样得出的两个数字放在一起非常刺眼:GPT-6 Astra 拿下 58.1% 的总评成绩(按部分给分累计),但能通过任务全部程序化测试的只有 2.8%。中间那 55 个百分点的落差,量的是同一件事的两面——智能体把界面抄得像不像,和做出来的东西到底能不能用。

RecreationWorld:参考应用当答案卷,隐藏行为测试当评分员参考应用(运行中)Ubuntu / macOS / Windows / Android / Web派生隐藏行为测试(先验证后冻结)智能体自由探索无预设工作流,自己摸清行为实现自己的应用版本评分GPT-6 Astra:总评 58.1%(部分给分) vs 全部程序化测试通过率 2.8%界面结构复制得像,交互次之,计算输出最差
图 1|RecreationWorld 用运行中的参考应用生成隐藏行为测试,答案卷不由人手写;总分与全对率之间 55 个百分点的落差,本身就是最有信息量的读数。

落差从哪来:抄得像不等于跑得通

论文的定性分析把落差拆开了:静态的界面结构被复制得最可靠,交互行为次之,需要计算和输出的部分最差。智能体生成的应用普遍比参考版本更小、更「一坨」——功能堆在一起而不是分层组织。换句话说,现有基准里常见的部分给分聚合指标,很大程度上在度量智能体复刻了多大面积的可见表面,而不是行为是否正确。RecreationWorld 有个值得同行学走的细节:它把总分和全对率并排公布,落差本身成了一个可以报告的量。这是对过去一个季度里「聚合分数被简单子项主导」这类批评给出的最响亮回应。

轨迹数据还有第二重价值。用 RecreationWorld 的轨迹训练出来的模型,在五个分布外的编码与混合计算机使用基准上都有提升,而且出现了一个比分数更有意思的行为变化:这些模型会更频繁地主动验证自己渲染出来的输出。分数涨是结果,「开始自查」这个习惯的养成,对生产环境来说可能比涨的那几分更值钱。

硬币的另一面:MintAct 用小模型统一三项能力

同日放出的 MintAct(arXiv 2609.22083)走的是成本这条线。过去做计算机使用智能体,常见配置是三个专家模型各管一摊:UI 定位一个、跨端导航一个、视觉工具调用一个。MintAct 用同一族视觉语言模型——2B、4B、8B 三个尺寸——把三项能力统一在一个模型里,各域成绩与对应专家模型持平,在 OSWorld-Verified 上拿到 48.9,与同尺寸专门模型相当。

MintAct:一小族模型统一三项能力,靠训练配比而非模型堆叠UI 定位(Grounding)多步导航(手机/桌面/网页)视觉工具调用同一族 VLM:2B / 4B / 8BOSWorld-Verified 48.9,追平各域专家模型基础设施数百个并发环境实例异步训练框架稳定扛噪声关键参数跨域训练配比显式受控每个 batch 来自哪个域由谁定
图 2|MintAct 的启示在于:小型模型的跨域能力统一不是靠更大的损失函数,而是靠对训练数据跨域配比的显式控制——这是个路由问题,不只是学习问题。

这篇论文的实质在基础设施:数百个并发环境实例横跨异构后端,同时服务轨迹采集与在线强化学习,异步训练框架在环境反馈噪声和离线策略漂移下保持稳定。作者的经验之谈是把跨域训练配比做成显式控制的旋钮——每个 batch 从哪个域来、由谁决定,这个「路由问题」才是买来统一化能力的那个参数,而不只是损失函数的形状。

两篇论文在同一天用同一个结构性思路落子:一个把运行中的成品当评估的答案卷,一个把成品当训练环境的素材。对做智能体评测和训练的团队,这份共同的判断或许比各自的数字更值得关注——能跑起来的制品本身就是现成的评估器,构建评估里最贵的部分是想明白这一点。两篇论文的完整作者名单、算力成本与更多消融细节,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。