论文
室外环境下具有几何目标定位的离线视觉语言导航
Offline Vision-Language Navigation with Geometric Goal Localization for Outdoor Environments
摘要
基于基础模型的视觉语言导航 (VLN) 具有先进的自主机器人导航功能,使机器人能够解释自然语言指令、识别语义目标并遵循用户指定的行为规则。然而,现有的 VLN 系统严重依赖云托管的基础模型来进行语言理解和语义基础,限制了它们在网络连接不可用且需要可靠的度量目标本地化的情况下的适用性。尽管最近的小语言模型(SLM)能够实现完全机载推理,但它们对导航指令分解的适用性尚未得到系统评估。本文为室外环境的完全机载 VLN 做出了三项贡献。首先,我们针对 4 个在线 API 提出了 17 个可边缘部署的 SLM 的第一个系统基准,用于机器人导航指令分解,评估三个计算平台上人工注释指令的准确性和延迟,并为选择板载语言模型提供实用指导。其次,我们提出了一种轻量级混合语义几何目标定位框架,该框架结合了开放词汇对象检测、提示分割和激光雷达几何来估计度量目标,同时在无法获得可靠的几何观测时保持视觉方位引导。第三,我们将这些进步集成到 Edge-BehAV 中,这是 BehAV 架构的完全板载扩展,可实现独立于云的行为引导导航。实验结果表明,最佳离线 SLM 与最强云 API 的指令分解性能相匹配,同时运行速度提高约 9 倍且无需网络连接。所提出的目标定位框架以较低的计算成本将平均目标距离误差从 2.05 m 降低到 0.20 m,并且整个系统在 32 次闭环户外试验中的 31 次中取得了成功。