论文
学习自适应视觉导航的语言条件可遍历性表示
Learning Language-Conditioned Traversability Representations for Adaptive Visual Navigation
摘要
可穿越性对于视觉导航至关重要,但随着机器人功能和用户偏好的不同而变化。传统的管道通常依赖于具有预定义标准的显式成本图或分段掩码,需要手工制定规则和仔细调整。此外,依赖于视点的分割掩模使感知延迟下的异步规划变得复杂。我们提出了 LaTraNav,一个学习语言条件可遍历性表示以实现自适应视觉导航的框架。其异步架构结合了慢速视觉语言模型和以这些表示为条件的快速流匹配规划器,该模型可生成可遍历性和导航目标的潜在表示。为了训练该系统,我们开发了一个具有可控轨迹的基于模拟的数据生成管道,生成与语言指令、可遍历性地图、目标位置和不同轨迹配对的观察结果。逼真的图像翻译进一步增强了视觉真实感。对多个来源的数据集的评估证明了有效的语言引导 通过慢速 VLM 进行可遍历性分割和目标定位,同时通过快速规划器进行自适应像素空间路径规划。与显式分段掩码相比,潜在调节提高了规划性能,而异步调度在相同的语义更新速率下将路径更新速率提高了 6.05\times$。