一个网络,四种模态
Reka Labs 10 月 5 日发布 Rho-1 的研究预览:一个 190 亿参数的全模态推理模型,从零训练,能在单一神经网络内理解与生成文本、图像、视频,并输出机器人控制动作。The Decoder 概括其与主流方案的区别:多数 AI 系统靠「规划模型 + 分发任务」的智能体流水线运转,每个环节调用各自的专家模型;Rho-1 把所有模态当作令牌放进同一个上下文窗口,没有工具调用,也没有幕后的第二模型。
官方演示是一条完整的长链路:让 Rho-1 画一座红白条纹灯塔,框选其中物体,把静态图动起来生成无人机飞近的视频,再把视频编辑成暴雪场景,最后让它对比两段视频说出了差异——每一轮都读写同一个上下文,而不是把图像导出给检测器、把提示词发给另一个视频模型。
反潮流:把流水线压扁
Reka 在博客里把矛头指向了当下最流行的工程形态:今天的多数 AI 系统是智能体流水线,中央模型负责规划与分发,各模态专家各管一段——每次交接都引入延迟,每个专家只看到被裁剪过的请求而非完整语境。Rho-1 的主张是把这个栈压扁:文本用离散令牌,图像与视频的潜变量、机器人动作与本体感知用连续令牌,全部共享一个 KV 缓存。有意思的是,一家做多模态模型的公司,把行业最热的「多模型编排」当成了要被替代的对象。
双流架构怎么转
据 AICoder 对技术材料的梳理,Rho-1 的每个 Transformer 块分成两条流:理解流与生成流共享注意力。理解流负责读入与推理,并发出一个交接令牌;生成流从累积的完整状态出发,经扩散头渲染出连续模态。训练目标同时优化下一词元预测与流匹配。视频生成基础版达 0.79 倍实时(中位数,厂商自测口径),约 6 秒可出可观看的流;蒸馏变体把去噪步数从 99 步压到 8 步,5.3 秒的片段约 1 秒出片。
机器人数据不够,拿互联网视频来凑
机器人训练数据的稀缺是这个领域的共同难题,Reka 的解法是另训一个逆动力学模型:从普通互联网视频里反推出控制信号,让预测相机图像的同一组权重也能驱动机器人动作。演示在 LIBERO 仿真环境进行,但官方没有公布成功率表格——能力边界主要靠演示而非评测集呈现,这是阅读本次发布时需要留意的口径。
算力账本与自认的短板
这笔训练账不算贵:320 块 H100,约三个月,从零训练。Reka 同时把短板写在明面上——原生视频分辨率上限 672×384;长程推演会出现「结构先于视觉」的漂移;跨视频的时序定位尚不可靠;定向编辑依然脆弱。公司称当前仍处于算力曲线的早期,各模态收益已经开始复利。
可得性与口径提醒
Rho-1 目前是研究预览:没有开源权重、没有公开 API、没有可复现的评测包,合作经由官方邮箱洽谈;官方提供的灯塔演示是企业自选案例,不能独立验证架构主张。Reka 并非新面孔——2024 年 4 月其 Reka Core 曾与 GPT-4、Claude 3 同台对标。放在更大的坐标系里,Rho-1 押注的是「世界模型」路线:单一模型、共享状态,作为多模型编排之外的另一条路。这条路线能否在规模上站住,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
小算力路线的弦外之音
抛开架构之争,这份发布里另一个值得圈出的数字是算力账:320 块 H100、三个月、从零训练。前沿实验室动辄以数万卡集群推进预训练的当下,一家公司用一套中等规模的集群把四个模态装进同一个网络,这本身就是一个信号——世界模型这条路线的入场券,可能比想象中便宜。对学术界与中小实验室而言,多模态统一不再是只有巨头能玩的游戏;对行业而言,「模态专家 + 编排」与「单一网络共享状态」两种工程路线的竞争才刚开局。当然,19B 体量的演示距离生产级的多模态能力还有明显距离,Rho-1 自己也把长程漂移、时序定位这些短板列在了明面上——路线之争现在下结论为时尚早,能确认的只是:通往实时交互式世界模型的候选路径,又多了一条值得跟踪的。