论文
Traj-VLN:通过自回归轨迹生成学习像素空间交互
Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation
摘要
受益于大规模预训练数据中嵌入的强大先验和新兴的常识推理能力,大语言模型(LLM)在许多研究领域表现出了前所未有的泛化能力。最近,通过视觉语言模型(VLM)将视觉嵌入投影到语言空间中以实现模拟和跨场景泛化已成为连续环境中视觉和语言导航(VLN-CE)领域的流行范例。 VLN 需要一个实体代理按照自然语言指令在看不见的环境中导航。我们强调,VLN 任务可以分解为一系列子任务,每个子任务对应于与“走到沙发尽头并向左转”等指令描述的环境进行 3D 空间交互的过程。然而,这种涉及沿着深度感测方向进入图像的空间交互对于 VLM 来说是令人困惑的,因为它们主要接受与 RGB 图像对话的训练。我们提出了一种替代方法:微调 VLM,通过自回归轨迹生成直接在 2D 像素空间中学习导航交互,而不是合并深度或 3D 几何信息(VLM 在预训练期间很少遇到这种情况)。给定语言指令和历史观察,我们的模型顺序预测一系列像素坐标,从当前观察的底部中心绘制轨迹。虽然之前的工作已经证明像素目标监督优于离散动作的学习,但我们的实验进一步验证了像素空间轨迹的监督显着增强了 VLN 性能。此外,我们证明我们的旗舰模型以相对有限的计算资源和训练数据实现了最先进的性能水平。