论文
GroundingVLN:以视觉证据定位衔接导航推理与动作
GroundingVLN: Reasoning and Acting with Grounding for Vision-Language Navigation
摘要
尽管视觉语言模型(VLM)具有强大的视觉理解和推理能力,但现有的视觉和语言导航(VLN)智能体很难将语义推理与空间执行联系起来。在这方面仍然存在两个耦合的差距,因为中间推理没有明确地锚定于视觉证据,并且高层决策缺乏指导低层运动的精确空间目标。认知科学表明,人类导航通过将认知锚定到相关地标并引导运动朝向空间目标,在层次上架起这些层次的桥梁。受这一原则的启发,我们提出了 GroundingVLN,它使用视觉基础作为推理和行动之间的共享接口。GroundingVLN 首先通过在结构化推理过程中将与任务相关的视觉证据锚定到精确的图像位置来进行基于视觉定位的推理。然后,它通过预测与进度对齐的像素目标来进行操作,几何规划器将其转换为原始动作。为了学习这些功能,我们构建了 GroundingCOTVLN-188K,这是一个时间对齐的基于视觉定位的推理轨迹数据集,并引入了视觉定位与执行感知强化学习 (GEAR),它将基于视觉定位的推理和空间决策与下游执行对齐。实验表明,GroundingVLN 实现了最先进的性能(R2R-CE 上的 SR 为 69.9%,RxR-CE 上的 SR 为 75.1%),并且样本效率很高,仅使用最强基线的 0.9% 的训练数据。它还具有很强的跨数据集泛化能力,仅在 R2R 上训练时,RxR-CE 上的 SR 达到 59.9%,比最强基线提高了 20.1%。