论文
用于通用机器人导航的视觉提示引导视频规划
Visual Cue Guided Video Planning for Generalizable Robot Navigation
摘要
通过将未来的观察结果预测为视频计划,生成视频模型可以作为机器人导航的有前景的支柱。最近的方法通常以短视距引导为条件进行视频规划,并通过场景重建恢复几何航路点,而对较长视距规划和精确的视频到动作转换的探索较少。我们提出了 CueNav,一种基于视频模型的导航框架,将视觉提示引导的视频规划与特定于实施例的逆动态模型(IDM)相结合。作为视觉提示,我们使用鸟瞰图(BEV)来传达全局任务上下文,并在以自我为中心的观察中保留机器人身体的一部分以暴露具体上下文。这些线索指导视频规划器,而 IDM 将从视频规划中提取的密集流场转换为机器人动作。通过对全局任务上下文进行编码的视觉提示,CueNav 在迷宫导航中取得的成功率比没有提示的规划高出近 2 倍。 IDM 的身体感知视图可在比较方法基本上无法完成任务的狭窄通道中实现精确导航,成功率为 70%。我们进一步演示了零镜头语义条件导航以及在不同机器人平台上部署相同的视频规划器。我们的结果表明,具有特定实施例动作基础的视觉提示引导视频规划为实现长期规划和实施例感知控制的通用导航框架铺平了道路。其他结果和代码可在我们的项目网站上找到:https://cuenav.github.io。