论文
SpaAct:空间激活过渡学习与课程适应视觉语言导航
SpaAct: Spatially-Activated Transition Learning with Curriculum Adaptation for Vision-Language Navigation
摘要
视觉和语言导航 (VLN) 旨在使实体代理能够遵循自然语言指令并在看不见的 3D 环境中导航到目标位置。我们认为,使 VLM 适应 VLN 需要赋予它们两种互补的能力来获得这种意识,即后向动作推理(为什么)和前向转换预测〜(如何)。基于这一见解,我们提出了 SpaAct,这是一个简单而有效的训练框架,可以激活 VLM 中的动态空间意识。具体来说,SpaAct 引入了两个空间激活任务:动作回顾(Action Retrospection),它要求模型从视觉转换中推断执行的动作序列;以及未来帧选择(Future Frame Selection),它迫使模型预测以历史和动作为条件的视觉转换。这两个目标为后向动作推理和前向转换预测提供了轻量级监督,鼓励模型以 VLM 友好的方式构建动态空间感知。为了进一步稳定适应,我们设计了TriPA,一种三因素渐进式自适应课程学习方法,从易到难组织训练样本,让模型逐渐获得从基本运动到长视野推理的导航技能。标准 VLN-CE 基准测试的实验表明,SpaAct 持续改进基于 VLM 的导航并实现最先进的性能。我们将发布代码和模型以支持未来的研究。