当地时间 9 月 17 日,人形机器人公司 Figure 发布了它至今最复杂的神经网络 Helix 2.5,随附的实验结果足够扎眼:搭载这套模型的 Figure 03 机器人,被带进旧金山湾区租下的 30 个陌生住宅,在事先没有进入过任何一个家庭采集数据、没有做过任何微调或环境适配的情况下,自主完成三种长时序行为——整理客厅、折叠毛巾、铺床。Figure 称,据其所知这是人形机器人在这个规模的真实家庭环境里,做到零样本全身泛化的头一回。

实验的关键不在机器人本身,而在一份叫 Index 的人类行为数据集。Figure 从真实家庭、物流中心、餐厅、工厂和办公室大量采集人类操作视频,用它预训练 Helix 2.5,再以少量任务数据让模型学会三种具体行为。机器人进入陌生家庭后,靠的不是重新学习这个房间,而是把从无数人类操作里学到的物理常识带进来:床的高度不同没关系,家具布局陌生也没关系。Figure 的表述很直白——人不需因为换了一间卧室就重新学怎么铺床。

30 个陌生家庭、三种长时序行为、零现场数据预训练Index 人类行为数据集:真实家庭、物流、餐厅、工厂的 操作视频行为适配一个基础模型出三种行为:整理客厅、折毛巾、铺床零样本进场30 个湾区家庭零采集零微调,全身自主完成(成功率 56% 对 9%)对照实验:任务数据、架构、训练与评测全部不变,只换是否用 Index 预训练
图|Helix 2.5 的零样本家庭实验

为了回答「泛化能力从哪来」,Figure 做了一组对照实验:任务专用数据、模型架构、训练方法与评测条件全部保持不变,只切换是否使用 Index 预训练。从随机权重开始训练的模型,在陌生家庭里的零样本成功率只有 9%;加入 Index 预训练后升到 56%。这组对照把功劳算得清清楚楚——零样本能力的大头来自人类经验的预训练,而不是任务适配。更进一步的发现是一条可预测的扩展规律:Index 预训练数据每翻一倍,下游机器人动作预测的损失平滑下降,平滑到 Figure 在训练前就把最大一轮的损失预测到了小数点后四位。能外推,意味着这笔投入的回报是可计算的。

效率数字同样在改善。与上一代 Helix 02 的代表性行为相比,Helix 2.5 只用了一半的任务专用数据,就把行为泛化到了 30 个前所未见的环境——行为规格化的成本降了一半,覆盖范围扩了 30 倍。机器人在陌生环境里还表现出可辨认的自我纠错:位置不合适会后退重新定位,会调整站姿,铺床铺歪了会绕到床的另一侧重新整理。Figure 认为这种从错误中恢复、持续推进的能力,正是 Index 预训练带来的效果之一。

人类经验迁移对垒逐场景训练逐场景训练(传统)机器人学哪、在哪采数据:换一个环境就要重学一遍经验迁移(Helix 2.5)从人类视频预训练获得物理常识,进场即作业可扩展性Index 每秒新增约 35 分钟人类行为数据,数据飞轮已转动冷静项:56% 成功率距离无人监督的家政服务仍有距离,任务域也有限
图|具身智能体的两条泛化路线

支撑这套打法的是一条已经转起来的数据飞轮和一笔看得见的算力投入。Index 目前每秒新增约 35 分钟的人类行为数据;Figure 已承诺投入价值 35 亿美元的算力资源训练 Helix,本月还与 AI 基础设施供应商 Nscale 签了多年期协议,锁定约 10 万块英伟达 Vera Rubin 系列 GPU 的算力供应,合同总规模最高有望达到 60 亿美元。新闻稿结尾的呼吁只有一句话:是时候扩大规模了。这与其说是给同行的宣言,不如说是给资本市场的叙事——更多数据加更多算力,应当直接转化为机器人进场前就掌握的更多物理世界知识。

冷静的部分必须说透。三种行为都是家庭场景里容错率较高的任务,56% 的成功率距离无人监督的可靠家政服务仍有相当距离;实验环境是湾区住宅,工业现场的刚性约束要苛刻得多;「据我们所知」的表述本身也说明这一成绩的边界条件由厂商自己划定,未经独立复核。家庭场景的安全与隐私问题——机器人带着摄像头和操作能力进入私人空间——在宣传物料里没有展开。但方向性的判断可以下:具身智能体的竞争正在从「逐场景训练」转向「人类经验迁移」,这与此前工厂场景的规模部署是两条不同的技术路线,谁先把泛化成功率推过可用门槛,谁就有机会定义家庭场景的产品形态。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。