论文

行动前预测:未来状态条件视觉语言导航

Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation

模型训练监督微调与指令调优

摘要

具有因果视觉语言模型的端到端视觉语言导航(VLN)将指令和以自我为中心的观察直接映射到行动,但标准行为克隆仅监督下一个行动,并且不明确鼓励政策状态预测未来的视觉结果,从而限制了长期决策。特权输入诊断表明,访问专家轨迹未来图像可以显着改善导航,表明未来观察包含丰富的、可操作的线索,尽管此类输入在部署时不可用。受此信号的启发,我们提出了未来状态条件 VLN (FSC-VLN),这是一种可部署的模型,它通过未来查询词元增强因果策略,并使用仅训练的未来状态监督将未来观察中的信息提取到策略状态中。具体来说,在训练期间,我们将未来查询表示与冻结的视觉嵌入 $Δ$ 提前对齐,而推理只需要过去和当前的观察。这种设计保留了基线推理模式,并且仅添加了两个学习的前缀标记,这意味着最小的开销。在 R2R val-unseen 上,FSC-VLN 在两种训练数据制度下比 StreamVLN 式基线提高了 SR/OSR/SPL,并且在长视野片段上有更大的增益;消融进一步支持将未来查询和操作查询分开的双查询设计。