具身智能落到产线,常被三道坎卡住——亚厘米级精度、执行时延、以及「越用越强」的经验复用。2026 年 9 月 21 日,清华大学联合无问芯穹、正行创新开源具身智能体基础设施 RPent(GitHub RLinf 组织),给出一种把数字世界智能体范式搬进物理世界的方案,定位就是降低具身任务的开发门槛。

它的核心是分层:通用大模型负责任务理解与规划,VLA 或 WAM 这类专家模型负责高精度动作,记忆系统沉淀经验,机器人抽象层把 MCP 工具协议下沉到硬件。规划与低层操作被解耦,规划层通用、执行层可替换专家模型,形成感知—反馈闭环,让机器人既听得懂任务、又能随环境调整动作。

把「规划—调用工具—反馈」缝进机器人

数字世界里的智能体早已跑通一套范式:规划、调用工具、看结果、修正。RPent 的价值在于把这套范式原样搬进物理世界,并把它产品化为开源框架。验证过的任务逻辑会沉淀成可复用的「任务卡」,下次遇到类似目标直接调用,不必从零编排。发布方同步放出多个真机 demo,例如按新目标重选放置位置、抓瓶后试抬确认夹稳,把抽象能力落到看得见的操作上。

把数字世界智能体的「规划—调用工具—反馈」搬进物理世界 通用大模型(规划层) 理解任务、拆解步骤、通用可控 VLA / WAM 专家模型(执行层) 高精度动作,专家可替换 记忆系统 沉淀经验、抗扰动 机器人抽象层 把 MCP 协议下沉到硬件 感知—反馈闭环:任务逻辑一旦验证通过,就沉淀为可复用的「任务卡」 规划与低层操作解耦,让团队不必每次都从零搭一套 Agent 编排
图 1|分层架构把「会想」与「会动」拆开,再用记忆与协议把两者缝成闭环

在 LIBERO-PRO 基准上,RPent 任务成功率达到 92.6%,领先第二名约 10 个百分点;端到端完成速度提升 7 倍以上。更值得说的是记忆带来的鲁棒性:引入记忆后,位置交换类扰动任务的成功率从 31.0% 升到 87.0%;Flash Mode 任务卡复用把平均执行时间从 283.6 秒压到 40.9 秒。这说明它直击的不只是精度,还有时延与经验复用这两道更硬的坎。

漂亮数字背后的口径与价值

需要看清口径:92.6% 是单一仿真基准的表现,与真机成功率不能直接换算,发布方也作了说明。对工业场景更有意义的是「任务卡复用」——它绕开了大模型推理往往慢于机器人动作周期的矛盾,让多班次连续运行比单次演示更值得期待。框架与编排层,正成为比单模型更稀缺的资产,开源叠加真机 demo 正是冲着这一点去的。

基准漂亮,但要看清口径 92.6% LIBERO-PRO 任务成功率 领先第二名约 10 分 7 倍以上 端到端 完成速度 仿真口径 31.0% → 87.0% 记忆使扰动任务 成功率回升 Flash Mode 284s→41s 92.6% 是单一仿真基准口径,与真机成功率不可直接换算,发布方也作了说明 真正价值在「任务卡复用」:绕开大模型推理慢于机器人动作周期的工程矛盾
图 2|数字亮眼,但开源加真机 demo 才是它降低具身开发门槛的底气

但开源与 demo 不等于规模落地。真机泛化、与安全控制系统的对接、以及在不同机器人本体上的迁移成本,仍是横在实验室与工厂之间的沟。RPent 的意义在于把「每个团队都从零搭一套 Agent 编排」的重复投入显性化,并用开源把门槛降下来。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

把 RPent 放进今年的具身节奏看,它的打法与同日宇树模型开源、阿里 Qoder 的 Harness 思路一致:单模型越来越难靠参数拉开差距,反倒是「把规划—执行—记忆缝起来」的编排层与框架,正在变成更稀缺的资产。开源叠加真机 demo,本质上是在抢「行业默认编排范式」的心智——谁能先让开发者用顺手,谁就更可能沉淀出生态与标准。

对国内团队而言,清华牵头、无问芯穹提供模型侧能力、正行创新补上工程与落地,这种「高校加模型厂加系统集成商」的组合也值得关注。它把学术范式、模型底座与产线需求压进同一个开源项目,比单点论文更接近可复用的产业基础设施,也更符合具身这类需要软硬协同的赛道。

总体看,RPent 沿着「LLM 规划 + 专家执行 + 记忆复用」的主流范式,做了一件务实的事:把范式工程化、开源化。它给具身行业的提示是——当模型能力趋于同质,真正拉开差距的,是谁把编排与经验沉淀做成可复用的基础设施,而不是谁又训了一个更大的模型。