论文
行动前寻求:视觉语言导航中寻求进展基础的证据
Seek Before You Move: Evidence Seeking for Progress Grounding in Vision-Language Navigation
摘要
视觉语言导航(VLN)要求智能体根据长期指令和部分自我中心观察不断地推动任务进展。现有的基于 VLM 的导航Agent通常仅根据可用的观察结果进行推理,即使任务相关的证据缺失,也可能保持自信。例如,即使指示下一个转弯的地标位于其当前视野之外,Agent也可能自信地继续前进并迷路。我们将这种失败模式称为“进步近视”:智能体无法识别不可靠的进步基础,并继续根据不足的证据采取行动。为了解决这个问题,我们提出了 SeekVLN,这是一种证据寻求框架,它将语义进展推理与任务相关观察的主动获取结合起来。 SeekVLN 分两个阶段进行训练:首先,未来引导反向生成(FRG)使用未来专家行动通过补充视图和证据注释来增强离线专家轨迹。对这些轨迹的监督微调为证据寻求和进展推理建立了先验,无需额外的专家互动。然而,仅靠模仿并不能揭示寻找是否可以改善后续导航。因此,我们引入反事实对比策略优化(C2PO)来进行强化微调。通过将每个证据寻求分支与来自同一状态的反事实直接导航分支进行比较,C2PO 使用对比奖励来根据后续导航收益将信用分配给寻求决策。模拟基准实验表明,SeekVLN 实现了最先进的性能,与 R2R-CE 和 RxR-CE 上的基本模型相比,成功率分别提高了 12.7% 和 7.5%。模拟和现实世界的评估都表现出类似人类的证据寻求行为,以实现更可靠的进展基础。