论文

IntentNav:从人类演示中学习空间视觉对象导航

IntentNav: Learning Spatial-Visual Object Navigation from Human Demonstrations

模型训练监督微调与指令调优

摘要

物体导航要求机器人通过在部分可观察性下决定下一步探索哪里来在未知环境中搜索未观察到的目标。有效的搜索类似于人类的探索:有选择地探索视觉上有希望的前沿,同时依靠空间记忆来避免冗余的重访。我们提出了 IntentNav,一个空间视觉模仿框架,可以从人类演示中学习类人的 ObjectNav 策略。为了从底层人类行为推断高级搜索意图,我们引入了基于前沿的人类意图标签,它展望人类演示并标记最能解释演示者未来搜索方向的前沿。我们构建了一个空间视觉候选空间,其中 BEV 记忆跟踪已探索的区域、未探索的前沿和轨迹历史,而自我中心的视觉记忆为每个候选提供语义线索。 VLM 策略经过训练,可以在这些脚踏实地的候选者中进行选择,使用意图一致的目标来鼓励一致的、类似人类的探索。 IntentNav 在 MP3D、HM3D-v1 和 HM3D-v2 ObjectNav 基准测试中实现了最先进的性能。所提出的候选级导航界面将零射击转移到轮式、四足和人形机器人,而无需进一步的 VLM 微调。 \href{https://anonymous.4open.science/w/IntentNav/}{项目页面}。