论文

StageVLN:用于高效视觉语言导航的空间和轨迹辅助指导

StageVLN: Spatial and Trajectory Auxiliary Guidance for Efficient Vision-Language Navigation

摘要

视觉和语言导航 (VLN) 策略越来越多地受益于大型视觉语言模型 (VLM) 提供的强大语义先验。然而,标准动作监督并没有明确鼓励中间表示来保留场景几何形状、相对方向或全局情节进度。在推理中结合深度估计器、显式地图、点云或几何基础模型可以提供此类结构,但会在部署期间引入额外的计算、记忆开销和架构依赖性。我们引入了 StageVLN,这是一个训练框架,它通过特权空间和轨迹指导来塑造导航表示,同时保留原始推理路径。冻结几何基础模型为分层导航器状态提供多级空间指导,而相对航向和专家路线进度目标提供补充的轨迹状态监督。所有辅助组件仅在训练期间使用,并在部署时删除。在未见的 R2R-CE 验证中,StageVLN 使用 4B-参数骨干模型实现了 56.3\% SR 和 51.4\% SPL,无需在推理时使用额外的几何编码器。在 RxR-CE 上,它无需额外的导航训练数据或推理时的几何编码器即可实现 54.3\% SR。

StageVLN:用于高效视觉语言导航的空间和轨迹辅助指导的原论文方法或结果图
图 1:StageVLN 概述。左:与显式 3D 输入和运行时几何融合的比较; StageVLN 仅在训练期间使用空间和轨迹引导,并在推理时单独保留导航器。右:导航成功和推理效率。 VRAM 和延迟是在单个 NVIDIA RTX 6000 Pro 上测量的。