论文
PathPainter:将图像生成模型的泛化能力转移到实体导航
PathPainter: Transferring the Generalization Ability of Image Generation Models to Embodied Navigation
摘要
鸟瞰 (BEV) 图像已被广泛证明可以为导航提供有价值的先验信息。鉴于这些视图提供的全局信息,仍然存在两个关键挑战:如何充分利用这些信息以及如何在执行过程中可靠地使用它。在本文中,我们提出了一种使用 BEV 图像作为全局先验的导航系统,专为地面和近地面机器人平台而设计。该系统采用图像生成模型从自然语言解释人类意图,识别目标目的地并生成可遍历性掩码。在执行过程中,我们引入了跨视图定位,将机器人的里程计与 BEV 地图对齐,并减轻传统里程计中的长期漂移。我们进行了广泛的基准实验来评估所提出的方法,并在无人机平台上进一步验证它。仅使用传统的本地运动规划器,无人机就成功完成了160米的室外远程导航任务。这项工作展示了如何将基础模型的世界理解能力转移到具体导航中,使机器人能够受益于现有图像生成模型的强大泛化能力。