技术拆解 No.1287

8 张 B200 炼出 397B 屏幕操作模型:Xenon 开源 Hunmin VLM 走了条杠杆路线

韩国生成式 AI 公司 Xenon 开源 Hunmin VLM 397B:以 Qwen3.5-397B-A17B 为底座做计算机操作特化,ScreenSpot-Pro 拿下 75.6 分、在 Hugging Face 榜单 48 个模型中位列第二,OSWorld 70.5 分较底座提升 22.3 分,而全程后训练只用了 8 张 B200。方法论文档把每一步都摊在阳光下。

计算机操作(computer-use)智能体的门槛,过去两年被反复抬高:要么是大厂的全家桶方案,要么是堆卡的从头训练。本周韩国生成式 AI 公司 Xenon 放出来的开源模型 Hunmin VLM 397B,示范了另一条路——不自己造底座,把「屏幕操作」能力当成可以移植、可以特化的东西来对待。

成绩单:榜单第二,代价是 8 张卡

按首尔经济日报的报道与随模型发布的方法论文档:Hunmin VLM 397B 以 Qwen3.5-397B-A17B 为底座(397B 总参数、17B 激活的 MoE 结构),在屏幕元素定位基准 ScreenSpot-Pro 上拿到 75.6 分,在 Hugging Face 官方榜单 48 个上榜模型中排第二,也是榜上出自韩国公司的作品;在 Linux 任务基准 OSWorld 上得分 70.5,比底座高出 22.3 分。方法论文档还写了在 Windows 桌面虚拟机里按 153 个任务、50 轮上限做执行式评测的设定。支撑这一切的后训练算力,只有 8 张 NVIDIA B200。

Hunmin VLM 397B 的后训练管线(方法论文档口径)1 · 底座:Qwen3.5-397B-A17B(397B 总参 / 17B 激活 MoE)2 · 低秩能力移植:对 Qwen-CUA 与底座的参数差做截断 SVD,做成 LoRA 适配器合并3 · 量化:官方同款细粒度分块 FP84 · SFT:ScaleCUA 数据(OpenGVLab)5 · Agent RL:GRPO + LoRA,环境为 ScaleCUA 与 CUA-Gym6 · 合并回 BF16 权重,开源发布硬件开销:全程 8 张 NVIDIA B200|软件栈:MS-Swift + Ray + Megatron-Core + vLLM
图 1|六步后训练管线:起点不是视觉微调,而是把既有 computer-use 能力做低秩移植。

管线拆解:能力是可以「搬」的

整条管线最有意思的是起点。Xenon 没有从视觉指令微调开始摸索,而是先算出已有的计算机操作模型 Qwen-CUA 与其同源底座之间的参数差,用截断 SVD 把这个差值近似成低秩分量,做成 LoRA 式适配器合并进自己的底座——相当于把别人的 computer-use 能力做了次低秩「移植」。此后才是常规动作:按官方同款方案做 FP8 细粒度分块量化,用 ScaleCUA 数据做监督微调,再用 GRPO 做带 LoRA 的智能体强化学习,环境取自 ScaleCUA 与 CUA-Gym,训练软件栈是 MS-Swift、Ray、Megatron-Core 与 vLLM。训练完成后合并回 BF16 精度发布。

成绩与代价(官方口径与公开榜单)ScreenSpot-Pro(屏幕元素定位)75.6 分OSWorld(Linux 桌面任务)70.5 分0 — 100 分刻度榜单位置48 个模型中第 2较底座提升OSWorld +22.3 分后训练算力8 张 NVIDIA B200成绩基于官方口径与公开榜单设定,独立复测仍待社区完成
图 2|两项关键基准成绩与三项背景条件:榜单位置、底座增益与 8 卡算力开销。

这条路线的边界

杠杆路线当然不是没有代价。低秩移植的前提是存在一个能力相近、架构同源的教师模型——这个位置现在恰好有人站着,等开源生态里没有现成教师可用时,这条路就走不通了;韩语通用能力评测在方法论文档里占了不小篇幅,说明通用与专化之间的平衡仍要花力气维护;榜单成绩基于官方口径与自报评测设定,独立复测仍有待社区完成。

分层生态正在成形

但趋势信号是清楚的:GUI 智能体正在从「少数玩家的全栈游戏」变成「开源底座 + 特化后训练」的分层生态。此前蚂蚁开源的 UI-Venus-2 走的也是这条路,区别只在杠杆的长短与着力点。对算力有限的团队来说,比从头训练更值得琢磨的问题是三个选择:底座选谁、教师选谁、移植哪一层。首尔经济日报把这条消息放进「韩国 AI 软件走向全球」的叙事里讲——榜单上多一支非中美队伍不是坏事,基准成绩的水分也会被挤得更干。

想用上它,先想清楚三件事

对考虑把这类开源模型接进生产流程的团队,这篇发布还有三点务实提醒。其一,397B 总参、17B 激活的 MoE 结构对推理侧不是小负担,端侧跑不动,部署要么自备多卡要么托管;其二,ScreenSpot-Pro 考的是屏幕元素定位这一层能力,真实业务链路里的多步任务成功率还取决于执行框架与容错设计,模型分高不等于流程通;其三,评测环境设定(分辨率、系统区域、任务池)与自家场景差异越大,分数参考价值越低,拿自己的真实任务重测一遍永远是值得的。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

← 返回智能体资讯列表