论文
WNM-3D:面向闭环视觉语言导航的3D场景条件世界导航模型
WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN
摘要
近期的视觉语言导航(VLN)系统越来越多地把预训练视觉语言模型(VLM)适配为视觉-语言-动作(VLA)策略,直接把自我中心观测与语言指令映射为导航动作。尽管语义能力强,这种以动作为中心的训练并未显式建模智能体的视觉观测在其预测运动下应如何演化。生成式世界-动作模型(WAM)联合预测未来观测与动作,但现有的连续VLN WAM并未让未来视角与动作的联合生成以从观测历史推断的几何感知表征为条件。我们提出WNM-3D,一个面向连续VLN、带3D场景条件的生成式世界导航模型。为了把过往观测整合为持久的场景上下文,一个冻结的前馈几何编码器从单目自我中心RGB历史中提取几何感知表征,可训练的3D场景到token适配器将其转换为世界-动作Diffusion Transformer的token空间中固定长度的前缀。通过块因果注意力,该前缀对每个未来视频-动作块施加条件,为未来视角与动作生成提供共享的几何上下文。我们通过在A*生成演示上的监督世界-动作微调、在策略实际访问的状态上的DAgger式适配,以及面向闭环执行的反事实DanceGRPO精调来训练WNM-3D。在GN-Bench上的实验表明,WNM-3D在闭环导航中优于强大的基于VLM的导航策略及其2D条件版本。分阶段消融进一步表明,DAgger-SFT带来更大的成功率增益,而反事实DanceGRPO随后同时提升导航成功率与路径效率。
