视觉语言导航(VLN)过去的研究,基本是一个智能体跟着一条指令走。可仓库、救援、配送这些真实场景,从来不是单人任务——是一队机器人分头行动、互相让路、共享一张地图。9 月 28 日提交的论文 Systematic Multi-Agent Vision-and-Language Navigation(arXiv 2609.35965,作者 Yunzhe Xu 与 Zhe Liu)做了一件基础但缺位的事:把「多智能体 VLN」正式立项成一个带约束的协调问题,并给出基准与方法两套交付物。

MAVLN:把协作写成带锁的拼图子任务带依赖与资源约束存在锁某些状态须同时在场持有链物体被占用时互相阻塞最多 4 个智能体145 个场景 / 11724 段剧情不再是「一个智能体跟一条指令」,而是「一支队伍解带锁的拼图」
图 1|MAVLN 把多智能体视觉语言导航形式化为约束协调问题:子任务带有依赖与资源约束(存在锁、持有链),队伍最多四人,跨 145 个场景构造出 11724 段剧情。

论文的形式化是它最值钱的部分。它把一次任务定义成一堆带依赖和资源约束的子任务:有些状态要求多个智能体「同时到场」(存在锁),有些物体被占用时会让后续步骤互相阻塞(持有链)。这不再是「一个智能体跟一条指令」,而是「一支队伍解一幅带锁的拼图」。基于此,作者用一套经过验证的四阶段构造管线,实例化出 MAVLN 基准:145 个场景、最多四人队伍、三种指令体制,共 11724 段剧情,并配了约束感知的评测指标。没有这套形式化,多智能体导航只能停留在演示,没法横向比高低。

为什么「形式化」这件事重要?因为具身多智能体长期缺一个公平的擂台:各家自己造场景、自己定指标,结果没法对话。MAVLN 把任务类型、约束种类、队伍规模、评测口径一次钉死,后来者只要在这个擂台上跑,就能说清自己强在哪。对学术圈,这是把一块散装方向收拢成学科的动作;对产业界,它暗示了下一个十年仓储、配送、巡检机器人要解决的,不是「单个更聪明」,而是「一群怎么不撞、不乱、不漏」。

方法侧,作者给出 TRISS 这个开箱即用的协作导航系统。它有三块:一个 LLM 子任务调度器负责把任务拆开并派活;一块共享拓扑记忆,让任一智能体的探索都变成全队的常识;再加一个冲突感知执行机制,把多个智能体同时冒出来的意图,落成互不碰撞的路线。这个结构和 Frontier Autolab 那篇讲的「组织记忆」异曲同工——都把「记忆该存什么」当成决定系统性格的旋钮,只不过一个在软件组织、一个在物理队伍。

TRISS:调度 + 共享记忆 + 冲突感知执行LLM 子任务调度器拆分并派活共享拓扑记忆探索即团队知识冲突感知执行并发意图 → 无碰撞路径约束感知指标衡量调度 / 规划 / 执行实验里 TRISS 是当前较全基线,但调度、规划、执行都仍有明显改进空间
图 2|TRISS 把 LLM 调度器、共享拓扑记忆(任一智能体的探索都变成团队知识)与冲突感知执行拼起来,把并发意图落成无碰撞路线,并配套约束感知指标。

实验的结论很克制:TRISS 是当前较全的基线,但调度、规划、执行三个环节都还有明显改进空间。这恰恰是这类基准该有的姿态——它不宣称解决,而是把差距清楚地标出来,等后来者填。作者也坦言,约束感知指标虽比粗粒度成功率更细,但仍未覆盖真实部署里的通信带宽、能源、故障恢复等现实成本。换句话说,MAVLN/TRISS 是块扎实的起跑线,不是终点线。

把它和同批其他论文放一起看,一条暗线浮现:2026 年的智能体研究,正从「单体能力」集体转向「协调结构」。CTWM 管单体的记忆形状,Frontier Autolab 管模拟组织的长期记忆,MAVLN/TRISS 管物理队伍的实时协调——三篇都在回答「怎么让一群智能体不内耗」。对做机器人或多智能体系统的团队,MAVLN 的提醒是:先别急着堆更大模型,先把任务拆成带锁的拼图、把探索变成共享记忆,协作的坑往往不在感知,而在谁该在何时去哪。

落到工程落地,MAVLN/TRISS 目前仍在仿真里验证,真实仓库里的通信延迟、传感器噪声与机器人故障,都会让那些约束比论文设定更脆。对想做多机协作的团队,务实的起步是先固化「任务拆图」与「共享地图」这两层基础设施,再把大模型调度作为可替换的上层来用——这样即便底层模型换代,协作骨架也不至于推倒重来,也能在真机出问题时更快定位是地图错了还是调度错了。