论文
前瞻:对导航重要线索的迭代推理
Foresight: Iterative Reasoning About Clues that Matter for Navigation
摘要
根据稀疏语言指令进行开放世界无地图导航需要解决未指定的目标并推断哪些环境线索与实现目标相关。例如,到达视线之外的目的地可能需要解释坡道、标志或绕行路线,以揭示要去哪里或走哪条路线。先前的工作受到对已知导航因素和封闭因素类别的依赖的限制,或者在运动计划之前识别线索并错过与计划相关的线索。我们认为,预训练的视觉语言模型(VLM)可以发现新颖的指令相关线索,但需要适应以关注哪些线索重要以及它们应如何影响运动计划。我们在 Foresight 中实现了这些想法,这是一个测试时框架,其中经过微调的 VLM 在提出图像空间运动计划和使用语言目标和视觉上下文对其进行批评之间交替。后续计划以先前的批评为条件,从而在执行之前实现迭代运动细化。为了使计划批评和改进与开放集行为偏好保持一致,我们从人类反馈中学习奖励模型,并使用它在计划批评循环中通过强化学习对 VLM 进行后训练。在离线评估和 6 个现实环境中,相对于最先进的测试时推理和基础模型基线,Foresight 将平均任务成功率提高了 37%,并将每个任务的干预减少了 52%,同时在 Jetson AGX Orin 上实时运行。我们将发布代码、数据和训练细节,以支持未来机器人运动细化的测试时推理工作。其他视频:https://amrl.cs.utexas.edu/foresight