论文
弥合 2D-3D 差距:用于视觉语言导航的分层语义几何图
Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation
摘要
视觉语言导航(VLN)使实体代理能够通过遵循语言指令到达看不见的环境中的目标位置。尽管视觉语言模型 (VLM) 最近取得了进展,但关键的语义几何差距仍然存在:虽然 VLM 擅长语言和 2D 视觉理解,但它们在 3D 空间推理方面遇到困难,无法捕获动作和空间转换之间的因果动态,导致导航不可靠,特别是在零镜头设置中。为了弥补这一差距,我们提出了一种分层语义几何图(HSGM),它将 3D 几何信息转换为与 VLM 兼容的结构化表示,从而有效地将它们与物理世界联系起来。具体来说,HSGM 表示为多通道自上而下的地图,组织为三个级别:(1)记录可导航区域和障碍物的几何级别,(2)表示对象及其关系的语义级别,以及(3)支持高级任务推理和目标选择的决策级别。在导航过程中,VLM 充当高级语义规划器,解释 HSGM 中编码的空间布局以选择几何上有效的航路点,而航路点之间的低级无碰撞运动由经典路径规划算法执行,从而将语义推理与动作执行完全解耦。此外,复杂的指令被分解为子任务,以缓解长视野导航中忘记进度或产生幻觉的问题。对 R2R-CE 和 RxR-CE 基准的大量实验表明,我们的零样本框架实现了最先进的性能,甚至优于几种监督方法。代码可在 https://github.com/Teacher-Tom/HSGM_public 获取。