论文

LatentPilot:通过潜在视觉推理提前梦想的场景感知视觉和语言导航

LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning

摘要

现有的视觉和语言导航(VLN)模型主要对过去和当前的视觉观察进行推理,而很大程度上忽略了由动作引起的未来视觉动态。因此,他们往往缺乏对行为之间的因果关系以及视觉世界如何变化的有效理解,从而限制了稳健的决策。相比之下,人类可以通过利用动作动力学因果关系来想象不久的将来,从而提高对环境的理解和导航选择。受这种能力的启发,我们提出了 LatentPilot,这是一种新的范式,它利用训练期间的未来观察作为有价值的数据源来学习动作条件的视觉动态,同时在推理时不需要访问未来的帧。具体来说,我们提出了一种飞轮式训练机制,迭代收集 同策略 轨迹并重新训练模型,以更好地匹配智能体的行为分布,并在智能体过度偏离时触发专家接管。 LatentPilot 在没有明确监督的情况下进一步学习视觉潜在标记;这些潜在词元在连续的潜在空间中全局参与,并跨步骤进行,充当当前输出和下一个输入,从而使代理能够提前梦想并推理行动将如何影响后续观察。 R2R-CE、RxR-CE 和 R2R-PE 基准测试取得了新的 SOTA 结果,跨不同环境的真实机器人测试证明了 LatentPilot 对场景中环境动作动态的卓越理解。项目页面:https://abdd.top/latentpilot/