2026年7月底,全球权威计算机操作智能体评测基准OSWorld完成最新榜单更新,浙江实在智能旗下「实在Agent」以90.20%的操作系统任务执行成功率,登顶总榜与智能体框架赛道双榜第一,创下该基准自发布以来的历史最高纪录,也是全球首个在OSWorld中突破90%成功率的智能体方案。OSWorld覆盖361个真实计算机环境课题,要求智能体像人一样直接操作图形界面、在真实系统中完成完整交互并生成可复现轨迹——任何一步理解偏差或操作失误都可能导致失败,几乎没有「碰运气」的空间。人类操作者在该评测下的平均成功率约为72%,实在Agent明显超过这一基准线。

一、90.20%意味着什么:从「勉强能跑」到「靠谱能用」

行业普遍把90%执行成功率视为一道临界线:在此之前,多数方案仅能在实验室简单场景里基础运行,长链路任务极易失败,被戏称为「可用不可靠」;跨过这条线,智能体才真正具备稳定作业、走向规模化商用的能力。纵向看,这条曲线相当陡峭——从GPT-4V时代的12.24%,到此前最高83.6%,再到如今的90.20%,一年多时间实现近7倍提升,并在顶端再跃一步,标志着Computer-Use Agent正式迈入「超高可靠性」阶段。对采购方而言,90%以上的成功率常被视为技术走出实验室、进入企业级生产环境的重要参考指标。

二、Harness工程:被低估的登顶密码

实在Agent走的是与多数巨头不同的路径。OSWorld榜单分设专用模型、通用原生模型、智能体框架三条赛道,Meta、MiniMax等多数厂商采用通用大模型直接执行任务的原生路线,性能高度依赖模型迭代与算力堆叠;实在Agent则采用「通用大模型 + 自研Harness工程框架」的双层架构,通过工程体系补齐纯模型在真实场景中的落地短板。Harness工程的核心是复杂任务的拆解调度、自我纠错与多智能体协同——换言之,模型是大脑,Harness是传动系统与控制装置,缺少它,再强的模型也只能原地轰鸣。本次TOP10高分方案中6席采用框架路线,且整体优于纯原生大模型,印证了行业正在形成的共识:Agent = Model + Harness,模型决定天花板,Harness决定能不能落地。

三、长链路与系统底层:国产框架路线跑通

拆解细分得分,实在Agent呈现「多点领先、核心场景大幅领先」的格局。最难的跨应用协同(multi_apps)场景拿到78.81分(共93个任务),领先第二名近10个百分点——这模拟的是「Chrome下载文件 → LibreOffice编辑 → 截图存档 → Thunderbird发邮件」这类连续穿梭多软件的长链路,最能检验规划能力;图像处理(GIMP)24/26(92.3%),证明非标准界面视觉理解深厚;系统底层操作(os)24/24满分,反映权限修改、进程管理、命令行等「错一步全盘皆输」任务里执行闭环的极高稳定性。实在智能成立于2018年、总部位于杭州,据称已服务超6000家企业客户,数千家企业的真实业务系统沉淀,是其Harness工程能力的重要来源。

四、客观看:90%是里程碑,也是新起跑线

价值在于它把行业注意力从「卷参数」拉回「卷工程落地」,证明框架路线能在真实复杂任务上跑赢纯原生大模型,给中国企业级智能体一条差异化突围路径。但客观边界也要摆清:基准成绩是在特定361个课题上的表现,真实企业环境的界面变动、权限体系、异常弹窗远比评测复杂;90.20%离「万无一失」仍有距离,关键业务容错率要求往往更高;此外框架路线的护城河,取决于能否持续把交付现场的经验沉淀为可复用组件,而非一次性刷分。实在Agent的突破值得肯定,但它更像一个信号:智能体竞争的下半场,赢家未必是模型最大的那家,而是最会把模型「用稳、用好」的那家。