论文

GA-VLN:用于高效视觉语言导航的几何感知 BEV 表示

GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation

上下文与知识上下文工程

摘要

尽管视觉语言导航(VLN)取得了重大进展,但现有方法仍然依赖于密集的 RGB 视频,这些视频会产生过多的补丁标记并缺乏明确的空间结构,从而导致大量的计算开销和有限的空间推理。为了解决这些问题,我们引入了几何感知 BEV (GA-BEV)——一种紧凑的、基于 3D 的特征表示,它将显式和隐式几何线索集成到基于多模态 大语言模型 (MLLM) 的导航系统中。我们通过将视觉特征投影到 3D 空间并将它们聚合到以代理为中心的布局中,从 RGB-D 输入构建 BEV 空间地图,从而在减少标记冗余的同时保持几何一致性。为了进一步丰富几何理解,我们将预训练的 3D 基础模型的特征合并到 BEV 空间中,注入从大规模 3D 重建任务中学到的结构先验。这些互补的线索(显式的基于深度的投影和隐式的学习先验)共同产生紧凑但具有空间表现力的表示,从而大大提高导航效率和性能。实验表明,我们的方法仅使用导航数据即可实现最先进的结果,无需 DAgger 增强或混合 VQA 训练,证明了所提出的 GA-VLN 框架的鲁棒性和数据效率。