论文
P2DNav:零样本视觉和语言导航的全景到俯视推理
P2DNav: Panorama-to-Downview Reasoning for Zero-shot Vision-and-Language Navigation
摘要
视觉和语言导航(VLN)需要一个实体代理将自然语言指令转化为看不见的环境中可执行的导航操作。现有的零样本方法通常依赖于额外的航路点预测模块,这些模块通常将高级定向推理与细粒度局部定位纠缠在一起,导致容易出错且不稳定的决策。在本文中,我们提出了 P2DNav,一种用于零样本视觉和语言导航的分层框架。 P2DNav 由三个核心组件组成:全景到俯视图 (P2D)、滑动窗口对话记忆 (SDM) 和反思式方向调整机制 (RRM)。 P2D明确地将导航决策分解为两个阶段:全景方向选择和俯视局部定位。它首先从 360° 全景图中选择与指令相关的方向,然后从该方向的俯视 RGB 观察中预测像素级目标点。此外,SDM 将导航历史组织为多轮对话上下文,并在滑动窗口内维护最近的视觉观察结果以支持长范围导航。 RRM 通过基于俯视观察评估本地局部定位的可靠性,并在必要时返回全景方向选择,进一步实现反思式方向调整。 R2R-CE 基准测试表明,P2DNav 在零样本方法中具有很强的性能。特别是,与最先进的(SOTA)基于零样本航路点和无航路点的方法相比,P2DNav 分别实现了 146.6% 和 58.9% 的 SR 增益,证明了 P2D、SDM 和 RRM 对于零样本 VLN 的有效性。代码将发布供公众使用。