论文

双锚定:解决视觉语言导航中的状态漂移

Dual-Anchoring: Addressing State Drift in Vision-Language Navigation

智能体系统Agent 架构与控制循环

摘要

视觉语言导航 (VLN) 要求代理按照自然语言指令在 3D 环境中进行导航。虽然最近的视频 大语言模型(Video-LLM)在很大程度上改进了 VLN,但它们在长时间场景中仍然非常容易受到状态漂移的影响。在这些情况下,代理的内部状态偏离真实的任务执行状态,导致漫无目的的徘徊并且无法执行指令中的基本动作。我们将这种失败归因于两种不同的认知缺陷:进度漂移(智能体无法区分已完成的子目标和剩余子目标)和记忆漂移(智能体的历史表示退化,使其失去对访问过的地标的追踪)。在本文中,我们提出了一种双重锚定框架,该框架明确锚定指令进度和历史表示。首先,为了解决进度漂移问题,我们引入了指令进度锚定,它监督代理生成结构化文本标记,以描述已完成的子目标与剩余的子目标。其次,为了减轻记忆漂移,我们提出了记忆地标锚定,它利用以地标为中心的世界模型来回顾性预测由分段任何模型提取的以对象为中心的嵌入,迫使代理明确验证过去的观察结果并保留访问过的地标的不同表示。为了促进这个框架的发展,我们整理了两个广泛的数据集:具有明确进展描述的 360 万个样本,以及用于回顾性验证的 937,000 个具备视觉定位的地标数据。在模拟和现实环境中进行的大量实验证明了我们方法的优越性,成功率提高了 15.2%,长视野轨迹显着提高了 24.7%。为了促进进一步的研究,我们将发布我们的代码、数据生成管道和收集的数据集。