论文
视觉语言导航中语义探索的路径级事后说明
Path-level Hindsight Instructions for Semantic Exploration in Vision-Language Navigation
摘要
同策略 探索是训练强大的视觉语言导航代理的关键组成部分,因为它将策略暴露给更广泛的状态分布。然而,这种探索不可避免地会导致偏离专家演示的轨迹,导致执行的视觉流与原始语言指令之间的语义不匹配。在这项工作中,我们通过引入 Phi-Nav 来应对这一挑战,这是一个统一的 同策略 框架,它利用事后推理来使指令与代理的实际探索旅程保持一致。具体来说,Phi-Nav 通过一个三阶段的双监督循环进行操作:1) 代理执行预言机引导的 同策略 探索,在从专家动作反馈中学习的同时采样轨迹,2) 后见演讲者根据收集的视觉观察合成路径级后见指令,3) 代理进行第二次模仿,将合成的轨迹指令对视为额外的专家演示。通过这个过程,Phi-Nav 弥合了 同策略 方法中固有的关键语义监督差距,将语义上未标记的运动转换为密集的训练信号。对 R2R-CE 和 RxR-CE 基准的评估表明,Phi-Nav 具有具有竞争力的性能,同时只需要当前基准使用的一小部分专家演示。这些结果强调了 VLN 中语义探索的必要性,将 Phi-Nav 定位为使用有限数据训练实体智能体的有效解决方案。