论文

使用旅游视频先验生成目标导向的导航指令

Goal-oriented Navigation Instruction Generation with Tour Video Priors

模型训练监督微调与指令调优

摘要

导航指令生成(NIG)旨在生成用于导航指导的分步自然语言指令。现有研究主要将 NIG 作为视觉和语言导航(VLN)的辅助任务,重点关注数据增强或多任务学习。然而,从紧凑的环境先验生成导航指令需要细致的空间推理,特别是当目标路线不简单地遵循演示的路线时,并且对于当前的多模式模型仍然具有挑战性。在这项工作中,我们介绍了 VideoNIG,这是一种以目标为导向的基于视频的 NIG 任务,它从以自我为中心的游览视频、初始观察以及文本或视觉目标生成导航指令,而不依赖于图形和地图等中间表示。我们在受控模拟器基准测试中实例化 VideoNIG,其中包含连续室内环境中的 60K 游览视频和具有渐进难度级别的 37K 多模式提示。我们进一步引入了一种诊断评估协议,该协议结合了文本相似性、基于选择的空间一致性测试和下游导航执行。为了解决这一任务,我们提出了一个两阶段的课程学习框架,将学习分解为基础运动感知和长视野导航推理。具体来说,我们首先采用动作预热来进行空间动作视图对齐,然后使用探索难度不断增加的轨迹进行复杂度进展。大量实验表明,现有的 MLLM 难以应对 VideoNIG,而我们的方法则显着提高了互补诊断指标的指令质量。最后,将 VideoNIG 生成的指令与 VLN 代理集成,展示了该任务制定的端到端导航的可执行性。