论文
用于视觉和语言导航的 On-and-离策略 联合学习
Joint On-and-Off Policy Learning for Vision-and-Language Navigation
摘要
视觉和语言导航(VLN)需要一个实体代理通过遵循自然语言指令在物理世界中进行导航。视觉语言模型(VLM)的最新进展推动了基于 VLM 的 VLN 方法的发展,该方法具有两种主要范式:(1)专家演示的模仿学习(IL),其次是数据集聚合(DAgger)算法以增强错误恢复能力; (2)强化学习(RL)由可验证的奖励驱动,以增强推理和探索。一个显着的差距是这两种不同范式之间缺乏整合。本文介绍了 JOP-VLN,这是一种新颖的 VLN 框架,它将 离策略 模仿学习和 同策略 探索协同结合在一个三阶段训练管道中。最初,IL 用于专家演示以获取基本的导航技能。随后,利用DAgger算法生成启发式探索轨迹,然后将其用于模仿学习以提高错误恢复能力。最后,实现了一个联合的 on-and-离策略 学习框架,具有高熵轨迹采样以提高 RL 训练效率和纠错优先轨迹排序策略以实现有效的纠错。大量实验证明了 JOP-VLN 的有效性,在 VLN-CE R2R 和 RxR 基准上分别实现了 69.9% 和 68.0% 的成功率,创下了 R2R 的新的最先进水平。项目页面:https://qingrongh.github.io/JOP-VLN。