论文
三思而后行:图像目标导航的层次推理
Think before Go: Hierarchical Reasoning for Image-goal Navigation
摘要
图像目标导航将智能体引导至看不见的环境中由图像指定的目标位置。现有方法主要通过学习端到端导航策略来处理此任务,该策略比较目标和观察图像的相似性并直接预测动作。然而,当目标较远或位于另一个房间时,此类方法无法提取信息丰富的视觉线索,导致智能体四处游荡。受人类认知原则的启发,即深思熟虑的高级推理指导复杂任务中的快速反应执行,我们提出了层次推理导航(HRNav),这是一个将图像目标导航分解为高级规划和底层执行的框架。在高层规划中,视觉语言模型在自我收集的数据集上进行训练,以生成短期计划,例如代理是否应该穿过门或沿着走廊走。这降低了长期任务的难度,使其更适合执行部分。在底层执行中,利用在线强化学习策略来决定根据短期计划采取的行动。我们还设计了一种新颖的徘徊抑制惩罚(WSP)来进一步减少徘徊问题。这些组件共同构成了图像-目标导航的分层框架。模拟和现实环境中的大量实验证明了我们方法的优越性。