论文
AirAnchor:桥接本地和全球空间信息,实现零射击空中视觉和语言导航
AirAnchor: Bridging Local and Global Spatial Information for Zero-Shot Aerial Vision-and-Language Navigation
摘要
空中视觉和语言导航要求无人机遵循自然语言指令并在复杂的城市环境中导航。精确导航依赖于局部和全局空间信息,它们分别支持即时行动落地和长期路径规划。然而,现有的零样本方法通常在单一空间尺度上运行,依赖于根据当前观察在线构建的局部表示或根据历史经验离线构建的全局记忆。为了解决这一限制,我们提出了 AirAnchor,这是一种新的范式,通过空间锚点连接本地和全球空间信息,并将两者集成到共享导航框架中,从而为决策提供全面的空间基础。 AirAnchor由三个核心组件组成:(1)查询驱动的空间锚点定位,它从视觉观察中识别与决策相关的锚点,并将它们组织成局部空间表示; (2)持久对象空间记忆,增量地将对象知识库维护为持久全局空间记忆,并检索与地标相关的空间先验; (3) 空间信息导航代理,它将局部和全局空间信息明确地集成到决策的代理框架中。 AerialVLN 上的大量实验表明,AirAnchor 大大优于现有的零样本基线,验证了所提出范例的有效性和效率。