论文

WorldMAP:用生成式世界模型自举视觉语言导航轨迹预测

WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models

模型训练合成数据

摘要

视觉语言模型(VLM)与生成式世界模型正在为具身导航开辟新机遇。VLM越来越多地被用作直接规划器或轨迹预测器,而世界模型通过想象未来视角支持前瞻推理。然而从单一第一人称观测预测可靠轨迹仍然具有挑战性。当前VLM常生成不稳定的轨迹,而世界模型虽能合成看似合理的未来,却不能直接提供导航学习所需的接地信号。这引出一个核心问题:如何将生成的未来转化为用于接地轨迹预测的监督信号?我们提出WorldMAP,一个师生框架,将世界模型生成的未来转化为持久的语义-空间结构与源于规划的监督。其由世界模型驱动的教师从生成的视频构建语义-空间记忆,接地任务相关的目标与障碍物,并通过显式规划产生轨迹伪标签。随后训练一个带多假设轨迹头的轻量级学生模型,直接从视觉语言输入预测导航轨迹。在Target-Bench上,WorldMAP在对比方法中取得最优ADE与FDE,相比最强竞争基线ADE降低18.0%、FDE降低42.1%,同时将一个小型开源VLM提升到与专有模型有竞争力的DTW性能。更广泛地说,这些结果暗示,在具身导航中,世界模型的价值可能不在于提供可直接行动的想象证据,而在于为导航学习合成结构化监督。

WorldMAP:用生成式世界模型自举视觉语言导航轨迹预测:论文配图
图 2:WorldMAP 的动机和设计原理。上图:仅 VLM 预测和世界模型增强推理对于单观测轨迹预测仍然不可靠。底部:受 LeCun 自主机器智能架构的启发,WorldMAP 围绕“世界-记忆-动作-感知”分解组织导航[1],并将生成的未来转换为持久的语义空间结构和规划衍生的监督,以实现轻量级学生预测器。