从路线到步骤:将视觉和语言导航中的语义进程与本地执行分开
From Routes to Steps: Separating Semantic Progress from Local Execution in Vision-and-Language Navigation
摘要
视觉和语言导航(VLN)要求代理通过以自我为中心的视觉观察执行其组成步骤来遵循路线级指令。现有的基于 VLM 的导航器通常仅通过下一步动作预测来监督这两种功能,使得进度跟踪错误与执行错误难以区分。当代理偏离路线时,纠正动作标签可以恢复下一个移动,但不指示代理是否选择了错误的子指令或未能执行正确的子指令。因此,代理可能会继续从错误的进度状态做出决策。为了解决这种歧义,我们提出了 \textbf{Route2Step},这是一个通过显式步骤级接口将语义进度跟踪与动作生成分离的框架。指令分析模块 ($\mathcal{M}_{\mathrm{IA}}$) 根据全局指令和视觉历史记录预测此状态。根据预测状态和最近的观察结果,动作生成模块 ($\mathcal{M}_{\mathrm{AG}}$) 生成本地动作块。为了在没有手动时间标签的情况下监控进度状态,E-SPA(一种步骤对齐过程)将子指令与其路线级演示的相应部分相关联。这些对齐可以对不正确的进度估计进行状态监督,而直接操作监督则保留给在正确的活动子指令下反复失败的转出组。在 R2R-CE 上,Route2Step 使用 190K 状态级校正样本将 SR 从 48.1% 提高到 55.3%,将 SPL 从 43.3% 提高到 48.2%,同时只需要 11.5K 直接动作监督状态。真实室内外环境中的实验进一步证明了Route2Step的实际适用性。项目页面为:https://sisyphus-hxy.github.io/Route2Step/。