让智能体管物理世界的长时程任务,是件比写代码、答问答难得多的事。灌溉要按时、施肥要看天,动作一旦执行不可逆,环境还会自己变。传统做法是拿强化学习训一个控制器,但要喂大量交互数据,环境一换往往就失灵。9 月披露的一篇论文换了个思路:用大语言模型智能体以零样本方式去管这类长时程物理任务,看它能不能在环境漂移时比 RL 更扛造。

为什么 RL 在物理任务上容易卡壳

RL 的麻烦在于数据和泛化。以暖通空调控制为例,训出一个好控制器可能要相当于一栋楼运行几十年的数据;更棘手的是,训练环境和部署环境很少完全一致,天气一变、传感器一老化,训好的策略就可能失效。物理世界的动态性,是 RL 部署很难绕开的墙。论文用农业场景做对照:让 LLM 智能体和 RL 智能体在不同天气模式下比管理灌溉与施肥。

增量认知:RL 的强项是「在同一环境里反复打磨到极致」,弱项是「换个环境就从头来」。LLM 智能体的强项恰好是零样本泛化——它不一定在某一个环境里刷到最高分,但环境一漂移,它的适应速度往往压过需要重新训练的 RL。

规划、工具、观测、核验的闭环

论文设计的多智能体框架,把物理任务拆成四个环节:规划出管理目标,调用工具执行动作,观测环境与植物状态,再核验动作是否达到预期,然后回到规划修正。这个闭环看起来朴素,却是长时程任务不跑偏的关键——每一步都有观测和核验兜底,而不是「下个指令就走人」。

物理智能体规划调用工具观测核验计划的动作要可观测、可核验,再回到规划修正,构成长时程闭环
图 2|把物理世界的动作拆成规划、工具调用、观测、核验四步并回环,是长时程任务不跑偏的关键。

在同样的天气模式下,零样本 LLM 智能体能拿到和 RL 相近的管理结果;当评估环境相对训练环境发生偏移时,LLM 智能体的表现下滑更小、恢复更快。换句话说,它不一定在稳态里赢,但在变化里更稳。

边界与适用场景

落地提醒:这套思路的代价是它吃模型本身的推理与规划功底。任务越需要精确的数值控制、越容不得一步差错(比如实时紧急停机),LLM 智能体反而未必合适;它更擅长「需要解释、需要权衡、环境会漂移」的管理类长程任务。论文本身也指出,目前仍属可行性验证,离直接接管关键基础设施还有距离。

对做机器人、农业自动化、设备运维的团队,这提供了一个值得试的替代视角:与其为每一种环境都训一个 RL 控制器,不如先让一个会规划、会观测、会核验的 LLM 智能体去顶上,把精确控制留给更底层。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

RL 智能体 vs 零样本 LLM 智能体RL:需大量交互数据RL:环境一变就失效LLM:零样本直接上LLM:漂移环境更自适应训练成本高、泛化脆代价是依赖推理与规划能力
图 1|RL 要喂大量数据且怕环境漂移;零样本 LLM 智能体上手快、在偏移环境下自适应更强,但吃模型本身的推理功底。

把物理世界的动作管理做成「规划—工具—观测—核验」的智能体闭环,而不是单一策略网络,或许正是长时程自主系统该有的样子。