论文
LightVLN:采用紧凑型记忆和历史引导本地聚合的高效空中视觉和语言导航
LightVLN: Efficient Aerial Vision-and-Language Navigation with Compact Memory and History-Guided Local Aggregation
摘要
空中视觉和语言导航(VLN)使无人机能够在复杂的三维环境中通过视觉观察执行长视距自然语言指令。然而,最近的航空 VLN 模型通常依赖于大规模视觉语言骨干模型和密集的视觉历史,造成大量计算和记忆成本,阻碍了机载部署。我们提出了 LightVLN,这是一种轻量级的历史感知航空 VLN 框架,它将紧凑的 0.5B 语言骨干模型与历史和当前观测的紧凑表示相结合。 LightVLN 使用策略已计算的视觉特征将每个历史帧压缩为单个token。它进一步引入了历史和指令条件的局部聚合,以将当前观察值从 256 个视觉token减少到 32 个,同时保留与导航相关的空间信息。 策略具有多达 16 个历史帧,最多使用 48 个观测衍生的token。在公共 OpenFly 数据集上,LightVLN 实现了 50.93% Test-Seen 和 36.14% Test-Unseen 成功率 (SR),在大多数报告指标上优于评估的 7B 语言骨干模型基线。它还在 AerialVLN-S Val-Seen 上实现了 25.83% 的 SR。在重建的看不见的园区中,我们在配备外部 Jetson Orin NX 16 GB 的 DJI M350 RTK 上部署 LightVLN,用于闭环板载计算实数到模拟硬件在环 (HIL) 评估,实现 14.61 Hz 模型推理和 11.13 Hz 端到端决策更新。这些结果证明了 LightVLN 用于航空导航的有效性和效率。
