论文

AirGroundVLN:目标导向空地协同视觉语言导航基准

AirGroundVLN: A Large-Scale Benchmark for Goal-Oriented Air-Ground Collaborative Vision-and-Language Navigation

模型评测上下文与知识智能体系统应用与实践记忆Agent 协作基准与评测资源机器人

摘要

面向目标的视觉和语言导航(VLN)要求智能体在没有规定路线的情况下定位并到达以自然语言描述的目标。空地协作对于需要广域搜索和细粒度定位的任务非常有价值。然而,由于缺乏大规模、多样化的基准和两个核心挑战,面向目标的空地协同VLN的系统研究仍然受到限制:1)空中和地面视图之间的巨大差异,以及随着导航的进行而无法获得有用的观测结果,使得很难在不同平台和时间上保持空间一致的背景; 2)不对称的空间可观测性使得地面感知局部详细但空间有限,空中感知广泛但局部粗糙,限制了单平台规划的可靠性。为了解决这些限制,我们引入了 AirGroundVLN,这是一个基准测试,包含 19 个虚幻引擎环境中的 10,281 个导航片段和 955 个目标实例,具有可见/不可见的分割和空中可见性协议 系统评价。除了基准之外,我们还提出了 AG-CoNAV,这是一个可训练的参考框架,包含两个关键组件:时空锚定协作记忆(SACM)和空中引导区域到地方规划(AGRLP)。 SACM 通过空中和地面观测维护和检索空间一致的历史背景。同时,AGRLP 将区域空中引导与细粒度地面导航相结合。大量实验证明了 AG-CoNAV 的有效性,并将 AirGroundVLN 确立为未来探索的综合基准。

AirGroundVLN:目标导向空地协同视觉语言导航基准:论文原图
图 1:AirGroundVLN 概述。该基准测试包含 10,281 个导航片段、955 个目标实例和 19 个面向目标的空地协作 VLN 的不同场景。它支持对空中可见/空中遮挡目标条件和可见/不可见环境进行评估。 AG-CoNAV 是作为此设置的可训练参考框架提供的。