论文
用于高效且可推广的视觉语言导航的结构化观察语言
Structured Observation Language for Efficient and Generalizable Vision-Language Navigation
摘要
视觉语言导航(VLN)需要一个实体代理通过遵循自然语言指令来导航复杂的环境,这通常需要视觉和语言模式的紧密融合。现有的 VLN 方法通常将原始图像转换为视觉标记或隐式特征,需要大规模视觉 预训练,并且在环境变化(例如光照、纹理)下泛化能力较差。为了解决这些问题,我们提出了 SOL-Nav(导航结构化观察语言),这是一种新颖的框架,它将以自我为中心的视觉观察转化为紧凑的结构化语言描述,以实现高效和通用的导航。具体来说,我们将 RGB-D 图像划分为 NxN 网格,提取每个网格单元的代表性语义、颜色和深度信息以形成结构化文本,并将其与语言指令连接起来,作为预训练语言模型 (PLM) 的纯语言输入。标准 VLN 基准(R2R、RxR)和实际部署的实验结果表明,SOL-Nav 显着降低了模型大小和训练数据依赖性,充分利用 PLM 的推理和表示能力,并对未见过的环境实现了强大的泛化能力。