论文
AVERT-VLN:用于视觉和语言导航的缺席感知视觉错误恢复和训练
AVERT-VLN: Abstention-aware Visual Error Recovery and Training for Vision-and-Language Navigation
摘要
在看不见的环境中部署视觉和语言导航(VLN)Agent仍然具有挑战性,因为不熟悉的布局和视觉条件可能会导致执行偏离轨道。实用的策略不是依赖持续的人工监督,而是有选择地请求纠正指导,恢复正在进行的任务,并重用纠正交互来改进后续导航。我们提出了视觉和语言导航的失控感知视觉错误恢复和训练(AVERT-VLN),这是一个闭环框架,使用插件视觉语言监视器进行在线人工辅助恢复和离线偏好学习。监视器与导航决策生成分开运行,并根据指令、视觉历史记录和当前观察来评估指令执行的一致性。为了训练监控器进行偏差识别,我们构建了 LOSTNAV 数据集,其中包含 20K 反事实风险轨迹和基于规则的偏差标签。 Monitor 首先对 40K 正常轨迹进行微调,以评估教学进度,然后对正常和风险轨迹进行联合微调,以识别语义偏差。在运行时,异步 Sidecar 监控会与导航模型一起评估执行情况。当控制器接受 LOST 判决时,它会暂停自主执行并请求人工指导进行恢复。对于离线策略改进,轨迹锚定偏好学习将与偏差相关的失败转换为共享决策上下文下的决策级偏好对,从而将监督限制在针对纠正的决策上。在人工辅助评估下,完整的 AVERT-VLN 系统在 R2R-CE 和 RxR-CE 的 val-unseen 分割上分别实现了 76.2% 和 66.3% 的成功率。相同的监控和人工辅助恢复界面还提高了三种评估的导航架构的成功率。