论文

NaViRrator:通过学习的视觉路线从人类可读的地图进行机器人导航

NaViRrator: Robot Navigation from Human-Readable Maps through a Learned Visual Route

智能体系统Agent 规划

摘要

人类可读的地图为指定机器人目的地提供了直观的界面,但将其示意性几何图形与以自我为中心的观察结果联系起来仍然具有挑战性。我们提出了 NaViRRator,这是一个框架,可将此类地图上用户指定的起始位置和目标位置转换为预训练视觉和语言导航(VLN)策略的导航指令。其核心方法 RouteScribe 首先在地图图像坐标中生成显式路线支架,然后由预训练的视觉语言模型 (VLM) 将其转换为导航指令,从而将路线推断与语言表达分开。我们使用起点-终点线条件流匹配(SGL-CFM)构建支架,它将直接的起点-目标航路点序列变形为地图条件路线。在执行过程中,VLN 策略仅接收指令和以自我为中心的观察结果,而映射和脚手架仍位于上游,允许执行器替换,而无需重新训练映射到语言模块。现实世界的实验表明,与直接映射到指令生成、基于 A* 的支架和高斯源条件流匹配相比,成功率和按路径长度 (SPL) 加权的成功率更高。定性结果进一步显示出更清晰的显着转弯和更好地保留预期的机动序列,支持基于路线的语言作为人类可读地图和预训练导航策略之间的模块化接口。