计算机操作(computer-use)智能体的门槛,过去两年被反复抬高:要么是大厂的全家桶方案,要么是堆卡的从头训练。本周韩国生成式 AI 公司 Xenon 放出来的开源模型 Hunmin VLM 397B,示范了另一条路——不自己造底座,把「屏幕操作」能力当成可以移植、可以特化的东西来对待。
成绩单:榜单第二,代价是 8 张卡
按首尔经济日报的报道与随模型发布的方法论文档:Hunmin VLM 397B 以 Qwen3.5-397B-A17B 为底座(397B 总参数、17B 激活的 MoE 结构),在屏幕元素定位基准 ScreenSpot-Pro 上拿到 75.6 分,在 Hugging Face 官方榜单 48 个上榜模型中排第二,也是榜上出自韩国公司的作品;在 Linux 任务基准 OSWorld 上得分 70.5,比底座高出 22.3 分。方法论文档还写了在 Windows 桌面虚拟机里按 153 个任务、50 轮上限做执行式评测的设定。支撑这一切的后训练算力,只有 8 张 NVIDIA B200。
管线拆解:能力是可以「搬」的
整条管线最有意思的是起点。Xenon 没有从视觉指令微调开始摸索,而是先算出已有的计算机操作模型 Qwen-CUA 与其同源底座之间的参数差,用截断 SVD 把这个差值近似成低秩分量,做成 LoRA 式适配器合并进自己的底座——相当于把别人的 computer-use 能力做了次低秩「移植」。此后才是常规动作:按官方同款方案做 FP8 细粒度分块量化,用 ScaleCUA 数据做监督微调,再用 GRPO 做带 LoRA 的智能体强化学习,环境取自 ScaleCUA 与 CUA-Gym,训练软件栈是 MS-Swift、Ray、Megatron-Core 与 vLLM。训练完成后合并回 BF16 精度发布。
这条路线的边界
杠杆路线当然不是没有代价。低秩移植的前提是存在一个能力相近、架构同源的教师模型——这个位置现在恰好有人站着,等开源生态里没有现成教师可用时,这条路就走不通了;韩语通用能力评测在方法论文档里占了不小篇幅,说明通用与专化之间的平衡仍要花力气维护;榜单成绩基于官方口径与自报评测设定,独立复测仍有待社区完成。
分层生态正在成形
但趋势信号是清楚的:GUI 智能体正在从「少数玩家的全栈游戏」变成「开源底座 + 特化后训练」的分层生态。此前蚂蚁开源的 UI-Venus-2 走的也是这条路,区别只在杠杆的长短与着力点。对算力有限的团队来说,比从头训练更值得琢磨的问题是三个选择:底座选谁、教师选谁、移植哪一层。首尔经济日报把这条消息放进「韩国 AI 软件走向全球」的叙事里讲——榜单上多一支非中美队伍不是坏事,基准成绩的水分也会被挤得更干。
想用上它,先想清楚三件事
对考虑把这类开源模型接进生产流程的团队,这篇发布还有三点务实提醒。其一,397B 总参、17B 激活的 MoE 结构对推理侧不是小负担,端侧跑不动,部署要么自备多卡要么托管;其二,ScreenSpot-Pro 考的是屏幕元素定位这一层能力,真实业务链路里的多步任务成功率还取决于执行框架与容错设计,模型分高不等于流程通;其三,评测环境设定(分辨率、系统区域、任务池)与自家场景差异越大,分数参考价值越低,拿自己的真实任务重测一遍永远是值得的。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。