论文

WNM-3D:面向闭环视觉语言导航的3D场景条件世界导航模型

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN

上下文与知识上下文工程

摘要

近期的视觉语言导航(VLN)系统越来越多地把预训练视觉语言模型(VLM)适配为视觉-语言-动作(VLA)策略,直接把自我中心观测与语言指令映射为导航动作。尽管语义能力强,这种以动作为中心的训练并未显式建模智能体的视觉观测在其预测运动下应如何演化。生成式世界-动作模型(WAM)联合预测未来观测与动作,但现有的连续VLN WAM并未让未来视角与动作的联合生成以从观测历史推断的几何感知表征为条件。我们提出WNM-3D,一个面向连续VLN、带3D场景条件的生成式世界导航模型。为了把过往观测整合为持久的场景上下文,一个冻结的前馈几何编码器从单目自我中心RGB历史中提取几何感知表征,可训练的3D场景到token适配器将其转换为世界-动作Diffusion Transformer的token空间中固定长度的前缀。通过块因果注意力,该前缀对每个未来视频-动作块施加条件,为未来视角与动作生成提供共享的几何上下文。我们通过在A*生成演示上的监督世界-动作微调、在策略实际访问的状态上的DAgger式适配,以及面向闭环执行的反事实DanceGRPO精调来训练WNM-3D。在GN-Bench上的实验表明,WNM-3D在闭环导航中优于强大的基于VLM的导航策略及其2D条件版本。分阶段消融进一步表明,DAgger-SFT带来更大的成功率增益,而反事实DanceGRPO随后同时提升导航成功率与路径效率。

WNM-3D:面向闭环视觉语言导航的3D场景条件世界导航模型:论文配图
图1:WNM-3D概览。(a) 历史前缀构建。WNM-3D使用冻结的VGGT-Ω和可训练的3D Scene-to-Token Adapter对单目RGB历史进行编码,以获得几何感知的场景前缀,而WNM-2D使用骨干网络原生的VAE编码RGB历史前缀。(b) 世界—动作联合潜变量建模。未来视觉与动作变量由共享的世界—动作DiT联合建模,以历史前缀连同当前帧和语言上下文为条件,产生时间对齐的未来视觉潜变量和导航动作。(c) 块因果自注意力。干净的历史前缀对所有时间块保持可见;视觉与动作token在每个块内交互,同时仅关注当前块及其之前的块,从而在预测时域内保持因果性。