当地时间7月30日,Google DeepMind抛出一套试图重新定义机器人行业分工的模型——Gemini Robotics 2系列。官方博客的第一句话写得很直白:「从脚到指尖——我们正在教机器人智能地控制全身、精细灵巧操作,以及团队协作。」同一时间,谷歌在社交平台X上给出的宣言更短也更锋利:「一个大脑。适用于任何机器人。」在所有人形机器人玩家都在卷「谁能先造出更好的本体」时,谷歌选择把赌注押在「大脑」上:不卖硬件,只卖机器人操作系统。
一、三件套:动作、规划、部署各司其职
Gemini Robotics 2不是单一模型,而是三个分工明确的模型。第一是Gemini Robotics 2,一个视觉-语言-动作(VLA)模型,把摄像头画面和自然语言指令直接转成电机控制信号。与早期版本只能控制上半身、在桌面上干活不同,新版能操控一台全尺寸人形机器人从脚到指尖的每一个关节——自己走到目标前、调整身体姿态、再用双手乃至多指灵巧手完成精细操作,例如先把水壶拿起、步行至置物架、再弯腰放进指定收纳箱。第二是Gemini Robotics ER 2,具身推理模型,不直接控电机,而是充当机器人的「高级大脑」:看视频、理解环境、规划多步任务,并把执行指令交给底层VLA;它首次引入多机器人协作,不同类型机器人可实时沟通、分工配合。第三是Gemini Robotics On-Device 2,在机器人本地机载计算机运行的轻量VLA,给不到200个示例、几小时就能适配一套全新双臂本体,并支持离线运行。动作、规划、部署三权分立,这套架构本身就是谷歌的竞争宣言。
二、从桌面到全身:控制范式的真实跃迁
过去一年各家具身demo大多集中在桌面操作——机器人站在原地伸手拿东西;Gemini Robotics 2把战场从桌面扩大到了机器人全身。官方示范里,Apptronik的Apollo 2人形机器人根据语音指令自行走到桌前拿起浇水壶,再步行至置物架放到指定位置;另一段演示由两台不同类型机器人合作完成同一项工作,无需人手逐步遥操。在容错上,ER 2引入基于摄像头画面的进度跟踪,执行出错时可识别最后正确步骤并从断点继续,不必从头重来。官方测试数据给出了诚实的刻度:控制机器人拆下灯泡成功率92%,但把灯泡装回去只有36%;绑垃圾袋、封密实袋、用畚箕等精细手指工作成功率在32%至44%之间;从地面拾取物件约46%。DeepMind机器人部门总监Kanishka Rao也坦承,追求真正的机器人灵活性是长期挑战,目前动作仍显缓慢与刻意。
三、不卖本体只卖大脑:谷歌的机器人OS赌局
「造机器人的宣言」和「造机器人之脑的宣言」是两回事。当特斯拉让Optimus练跑步、Figure AI的工厂以每小时一台的速度下线Figure 03时,谷歌站在旁边掏出三个模型问了一句:你们的机器人,要不要试试我的系统?在ER 2已通过Gemini API和Google AI Studio向开发者开放、VLA主力与On-Device 2仅面向早期合作伙伴(部署伙伴包括Apptronik、Franka、敏捷机器人Agile Robots)的安排下,谷歌的打法清晰:把AI能力做成每个机器人都能接入的智能层,而非亲自下场做硬件。这与赛道主流的「垂直整合」路线形成对照——多数头部玩家试图把本体、控制器与模型全攥在手里,谷歌则赌「大脑标准化、本体多样化」的分工会更高效。其目标,用卡罗琳娜·巴拉达的话说,是「把AI带入物理世界,并构建每个机器人都能使用的智能层」。
四、客观看:能力跃迁与真实边界
价值在于,Gemini Robotics 2从架构层面验证了「人形机器人行走与操作的分层拼接,未来将在同一模型内走向协同」这一方向,并把高级推理、动作控制与端侧部署拆成可独立演进的模块,给行业提供了一套可参考的机器人OS范式。同步推出的ASIMOV-Agentic Benchmark具身AI安全基准,也把「避免碰撞及其他潜在风险」纳入可评测范畴,补上了安全度量这块缺口。但边界要讲清:其一,拆灯泡92%与安装36%的悬殊,说明长程精细操作的鲁棒性远未解决,所谓「全身智能」更多体现在移动加抓取,而非真正灵巧;其二,ER 2虽已开放,VLA主力与On-Device 2仍限早期伙伴,真实世界泛化能力有待大规模部署检验;其三,谷歌的「大脑外售」路线是否成立,取决于本体厂商是否愿意把最核心的智能层交出去——垂直整合派恰恰押注的是「软硬一体才能把体验做到极致」。谷歌的赌局有意思,但机器人OS的归属,远未到盖棺定论的时候。