论文
WorldMAP:用生成式世界模型自举视觉语言导航轨迹预测
WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models
摘要
视觉语言模型(VLM)与生成式世界模型正在为具身导航开辟新机遇。VLM越来越多地被用作直接规划器或轨迹预测器,而世界模型通过想象未来视角支持前瞻推理。然而从单一第一人称观测预测可靠轨迹仍然具有挑战性。当前VLM常生成不稳定的轨迹,而世界模型虽能合成看似合理的未来,却不能直接提供导航学习所需的接地信号。这引出一个核心问题:如何将生成的未来转化为用于接地轨迹预测的监督信号?我们提出WorldMAP,一个师生框架,将世界模型生成的未来转化为持久的语义-空间结构与源于规划的监督。其由世界模型驱动的教师从生成的视频构建语义-空间记忆,接地任务相关的目标与障碍物,并通过显式规划产生轨迹伪标签。随后训练一个带多假设轨迹头的轻量级学生模型,直接从视觉语言输入预测导航轨迹。在Target-Bench上,WorldMAP在对比方法中取得最优ADE与FDE,相比最强竞争基线ADE降低18.0%、FDE降低42.1%,同时将一个小型开源VLM提升到与专有模型有竞争力的DTW性能。更广泛地说,这些结果暗示,在具身导航中,世界模型的价值可能不在于提供可直接行动的想象证据,而在于为导航学习合成结构化监督。
