9 月 9 日的京东全球科技探索者大会(JDD)上,京东开源了实时可交互世界模型 JoyAI-Echo WM。它可以根据用户的移动和视角变化持续生成世界,同步输出 720P 视频、环境音、音乐与语音,支持第一/第三人称及多轮连续交互,并在 WBench Navigation 基准以 81.6 分登顶、场景一致性达 89.8%。世界模型赛道,终于不再是谷歌和 OpenAI 的独角戏。
一、世界模型从「看」到「进」
过去的世界模型大多停留在「生成一段能看的视频」,而 JoyAI-Echo WM 强调「可进入」:用户视角一变,画面与声音随之实时重建,音画同步、交互连贯。这意味着它不再只是内容生产的玩具,而是能作为仿真、训练与交互的底层环境。对京东而言,这与其「全球最大物理世界运营中心」的野心高度契合——仓储、物流、零售积累的真实具身数据,正好是世界模型最稀缺的训练燃料。
二、用物流具身数据训练,再反哺仿真与机器人
京东的路径很清晰:用仓储和物流场景的具身数据训练世界模型,再反哺机器人仿真与真实部署。世界模型相当于给机器人造了一座可无限试错的「平行仓库」——先在虚拟世界里把抓取、搬运、分拣练熟,再迁移到实体。这种「数据—模型—机器人」的闭环,比单纯比拼生成画质更有商业纵深,也解释了京东为什么愿意把这个能力开源:生态越早用起来,数据飞轮转得越快。
三、赛道不再只是谷歌与 OpenAI 的独角戏
世界模型此前主要由 DeepMind、OpenAI 等头部实验室主导,京东的加入带来一个信号:拥有真实物理运营数据的产业方,正成为这条赛道不可忽视的新玩家。开源 JoyAI-Echo WM 既能吸引开发者基于它构建应用,也能在标准尚未定型的阶段抢占生态位。当然,模型最终能否跑出商业闭环,仍取决于它进的是仓库产线还是只进发布会——这是所有世界模型厂商共同的考题。