论文

NavOne:自上而下地图上视觉语言导航的一步式全局规划

NavOne: One-Step Global Planning for Vision-Language Navigation on Top-Down Maps

摘要

现有的视觉语言导航(VLN)方法通常采用以自我为中心的、循序渐进的范式,它会与错误积累作斗争并限制效率。虽然最近的方法试图利用预先构建的环境地图,但它们通常依赖于增量更新内存图或对离散路径建议进行评分,这限制了连续空间推理并产生离散瓶颈。我们提出了自上而下的 VLN (TD-VLN),将导航重新表述为预先构建的自上而下地图上的一步全局路径规划问题,并由我们新构建的 R2R-TopDown 数据集支持。为了解决这个问题,我们引入了 NavOne,这是一个统一的框架,可以在单个端到端前向传递中直接预测多模态地图上的密集路径概率。 NavOne 具有用于联合多模式地图表示的自顶向下地图融合器,并扩展了注意力残差以实现空间感知深度混合。 R2R-TopDown 上的大量实验表明,NavOne 在基于地图的 VLN 方法中实现了最先进的性能,其规划阶段加速比现有基于地图的基线提高了 8 倍,比自我中心方法提高了 80 倍,从而实现了高效的全球导航。