论文

NavWAM:目标条件视觉导航的导航世界行动模型

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

模型训练预训练

摘要

目标条件视觉导航要求机器人在部分可观察性下行动,预测其运动将如何改变未来以自我为中心的观点,以及这种变化是否使其更接近目标。导航世界模型提供了这种视觉远见,但它们仍然是预测模块,需要外部规划器将预测的未来转换为闭环控制。我们提出了导航世界行动模型(NavWAM),这是一种扩散 Transformer 策略,通过在共享潜在序列中表示未来观察、目标进度值和行动块,将导航世界模型预测转化为可执行行动。通过联合学习未来预测以及确定闭环行为的行动和价值目标,NavWAM 使视觉预见可直接用于机器人控制。我们通过模拟预训练和真实机器人适应构建 NavWAM,并根据基于规划的世界模型和代表性的直接导航策略对图像目标导航进行评估。在离线基准测试和闭环真实机器人部署中,NavWAM 在我们的评估中改进了基于规划的世界模型基线,同时使用默认策略模式,无需 CEM 式动作搜索。项目页面:https://dachii-azm.github.io/navwam/