论文
WorldVLN:航空视觉语言导航的自回归世界行动模型
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
摘要
空中视觉语言导航 (VLN) 要求智能体通过 3D 环境中的闭环感知和行动来遵循自然语言指令。我们认为,空中 VLN 可以表述为预测驱动的世界行动问题:智能体应该预测潜在的世界演化并根据预测的结果采取行动。为此,我们提出了 WorldVLN,这是第一个航空 VLN 的自回归世界行动模型。与生成整个视觉剪辑的全序列视频生成世界模型不同,WorldVLN 采用潜在的自回归视频主干来预测短视野世界状态转换,并将其直接解码为可执行的路点动作。执行每个动作片段后,新接收到的观察结果将被编码回自回归上下文中,从而实现闭环世界动作预测。我们进一步引入了一个两阶段训练框架,首先将视频置于指令条件导航动态中,然后开发动作感知 GRPO,这是第一个针对自回归 WAM 定制的强化学习方法,通过其下游采样轨迹结果来优化航路点决策。在公共室外和室内基准测试中,WorldVLN 始终优于现有的视觉-语言-行动基准,成功率提高了 12% 以上,并且在具有挑战性的案例中具有更大的优势。它将零射击进一步转移到真正的无人机部署,这表明所提出的 WorldVLN 为空间行动任务提供了一条有前途的途径。演示和代码可在 https://embodiedcity.github.io/WorldVLN/ 获取。