计算机使用智能体(computer-use agent)这两年很热,可多数基准考的还是「点开网页、填个表」这类通用办公动作。科研软件是另一块硬骨头:分子绘制要出正确的结构式,统计计算要出能复现的数值,病理分析要出分割掩膜——界面专业、操作链长、而且结果能验证。9 月提交的论文 OSWorld-Science(arXiv 2609.39903)做的正是这件事:把计算机使用智能体放进真实科研软件里考,并用「生成物」而不是「答了什么」来评。

OSWorld-Science:科研软件上的计算机使用智能体12 个 VLM跨多语言 / 推理力度测146 项任务分子绘制 / 逆向合成 / 病理 / 统计 / 仿真专家提案 + 人智共设按科学价值与难度筛选成果型评测看应用状态与生成物,给部分分从「答得对不对」转向「产物对不对」——科研软件是更硬的一关
图 1|OSWorld-Science 用 12 个视觉语言模型、146 项覆盖分子绘制、逆向合成、病理图像、统计计算与物理仿真的任务,经专家提案与人和 AI 共设筛选,并以应用状态与生成物做成果型评测。

这个基准的构造分三块。其一是任务:覆盖分子绘制与逆向合成、病理图像分析、统计计算、物理仿真等科学领域,共 12 个视觉语言模型、146 项高质量任务,跨多种软件配置。其二是任务来源:由领域专家提案、再经人和 AI 共设迭代筛选,选科学价值高、难度够的任务,避免凑数。其三是评测:执行型评测器直接检查软件内部状态与生成物——分子结构对不对、分割掩膜准不准、图表与数值能不能复现,并且对不完整的产出给部分分,而不是全有全无。整个特殊 harness 把模型适配、交互循环控制与轨迹日志整合起来,方便横向比较模型与交互策略。

为什么「看生成物」这一步关键?因为科研软件的价值出口是产物:一篇能复现的图、一个正确的分子式、一份对齐的掩膜。传统「问答对」评测测不出这些——智能体可能把步骤说得很顺,产物却是错的。OSWorld-Science 把评测锚定在应用状态与生成物上,等于把计算机使用智能体从「看起来会操作」推向「操作出了正确结果」。这对药物发现、材料、医学影像这类容错率极低的方向,是更贴近真需求的标尺。

对做评测的人来说,OSWorld-Science 还顺手演示了一种更诚实的基准做法:任务由领域专家提案、再经人机共设筛选,而不是工程师凭想象编一批「能跑通就好」的题。这样做虽慢、还容易暴露模型短板,却让分数更有意义——它考的是真实科研里会卡住人的地方,而非为刷分优化的玩具任务。部分分机制也值得借鉴:科研操作常是长链,半对半错比全对全错更常见,给中间产出打分,才能看清模型到底卡在哪一步。这种「以真实任务为锚、以生成物为准、以部分分为尺」的三件套,值得成为垂直领域智能体基准的标配。

评测看两样:应用状态 + 生成物应用状态检查软件内部状态是否到位(如分子结构、掩膜)生成物plot / 数值结果 / 分割掩膜等可验证产物部分分未完成也按完成度给分,避免全有全无强 harness 下的 SOTA VLM 仍吃力——多语言 / 推理力度 / 上下文长度都显著影响
图 2|OSWorld-Science 的执行型评测器检查应用状态与生成物(分子结构、分割掩膜、图表、数值),对不完整产出给部分分;即便配强 harness,顶尖视觉语言模型在科研软件上仍明显吃力。

结果很克制:即便配强 harness,当前顶尖的视觉语言模型在科研软件上仍明显吃力;论文还分析了多语言、推理力度、上下文长度等因素的影响,发现它们都显著改变表现。换句话说,通用 VLM 的「能聊天」不等于「能在专业软件里把活干对」,中间还隔着专用界面、领域知识与可验证产物这三道坎。这恰恰指出了计算机使用智能体下一步该补的不是更大模型,而是领域适配与更可靠的执行回路。

把它和同赛道其他基准连起来看会更清楚:AgentWorld 考多智能体长程协作、OSWorld 系考单智能体操作桌面,OSWorld-Science 则是把「操作」钉进科研这一高验证要求的垂直场景。三者共同把计算机使用智能体的评测从「能不能动」推到「动得对不对、产出可不可验证」。对做科研智能体与科学助手的团队,OSWorld-Science 的提醒是:先别急着宣称「AI 帮科学家做实验」,先把「产物可验证」这层评测与执行闭环做扎实——在科研里,一个漂亮但错误的分子式,比不会画更危险。它目前仍是 146 项任务的早期基准,覆盖面与跨软件泛化仍在扩展中,但「以生成物为准」的取向,值得成为这类基准的默认姿态。