论文
是什么限制了视觉和语言导航?
What Limits Vision-and-Language Navigation ?
摘要
视觉和语言导航(VLN)是体现智能的基石。然而,当前的代理在从模拟过渡到现实世界部署时通常会遭受显着的性能下降,这主要是由于感知不稳定(例如,照明变化和运动模糊)和指定不足的指令。虽然现有方法试图通过扩大模型大小和训练数据来弥补这一差距,但我们认为瓶颈在于缺乏稳健的空间基础和跨域先验。在本文中,我们提出了 StereoNav,这是一个强大的视觉-语言-动作框架,旨在增强现实世界导航的一致性。为了解决综合训练和身体执行之间固有的差距,我们引入目标位置先验作为持久的桥梁。这些先验提供了稳定的视觉指导,在各个领域中保持不变,即使指令模糊,也能有效地为代理奠定基础。此外,为了减轻运动模糊和照明变化等视觉干扰,StereoNav 利用立体视觉构建语义和几何的统一表示,通过增强的深度感知实现精确的动作预测。 R2R-CE 和 RxR-CE 上的大量实验表明,StereoNav 实现了最先进的以自我为中心的 RGB 性能,SR 和 SPL 得分分别为 81.1% 和 68.3%、67.5% 和 52.0%,同时比之前基于缩放的方法使用的参数和训练数据明显更少。更重要的是,现实世界的机器人部署证实了 StereoNav 显着提高了复杂、非结构化环境中的导航可靠性。项目页面:https://yunheng-wang.github.io/stereonav-public.github.io。