9 月 9 日,智元机器人一口气甩出两款模型:AGILE 2.0 感控一体模型与 GE-Act 2.0 原生世界—动作模型。前者回答的是「机器人能不能像人一样边看边动」,后者则瞄准一个更底层的问题——机器人模型能否像大语言模型那样,靠不断堆数据持续解锁新技能。两条线指向同一目标:让机器人真正理解真实世界、持续行动并适应复杂场景。

一、把「眼」和「手脚」塞进同一个模型

传统机器人系统里,视觉感知、运动规划与执行控制往往分属不同模块:相机采完画面,AI 识别目标、算位置,再把指令交给运动控制系统。一旦环境快速变化,视觉信号和肢体动作之间的时间差就会让机器人抖动、失稳甚至中断。AGILE 1.0 曾率先打通感知与运动链路,而 AGILE 2.0 更进一步,把环境观测、地形理解、动态可通行性分析、全身运动控制、接触状态切换与末端精细操作全部耦合进一个端到端、无中间模块的闭环,实现视觉信号实时推理与运动指令的毫秒级协同。

二、踩球行走为什么是道硬门槛

为了直观展示这套能力,智元拍了一支「机器人杂技团」短片《杂技 BOT》:灵犀 X2 钻火圈、抖空竹、三人跳长绳、双人协作搬箱子。其中最难的「踩球行走」——双脚站在滚动大球上仅凭视觉与足底反馈实时找重心——是行业内双足人形机器人首次自主实现踩球。这个动作难点不在平衡本身,而在于机器人必须实时判断球体、身体与周围环境的变化,同时连续调整姿态和脚步。跳长绳时要看准绳子节奏、搬箱子时要根据同伴动作见机行事,背后都是「看见环境变化并立刻转化为身体动作」的能力。

三、GE-Act 2.0:机器人能不能走 Scaling 定律

如果说 AGILE 2.0 给了机器人更像人的运动能力,GE-Act 2.0 则尝试回答具身智能一个基础命题:把训练数据扩大 100 倍,机器人能否像大模型一样持续解锁新操作?这条原生世界—动作(World-Action)路线,把「感知—动作」统一到一个可扩展的数据飞轮里,让模型从海量真实交互中自我进化。对行业而言,AGILE 2.0 解决的是「动得稳」,GE-Act 2.0 指向的是「学得会」——两者合起来,才构成具身智能从演示视频走向产线良率的真正分水岭。