论文

VLN-AVP:具有混合长短期记忆的零射击视觉语言导航,用于自动代客泊车

VLN-AVP: Zero-Shot Vision-Language Navigation with Hybrid Long-Short-Term Memory for Autonomous Valet Parking

摘要

自动代客泊车(AVP)中的现有方法通常依赖于预先构建的地图,这严重限制了它们对不可见环境和开放词汇目标的可扩展性。受视觉语言模型(VLM)在视觉语言导航(VLN)任务中应用的启发,我们提出了 VLN-AVP,一种用于 AVP 任务的零样本导航框架。通过将鸟瞰 (BEV) 模型的精确空间感知与 VLM 的通用智能相结合,我们的框架 1) 消除了对预构建地图的依赖,2) 解释停车场景中的语义环境上下文,3) 实现遵循自然语言指令的直观导航。具体来说,我们引入了一种混合记忆系统:短期感知记忆跟踪语义视觉线索,以解决现有方法中 VLM 单帧推理的局限性,而长期拓扑记忆则有助于从过去的经验中进行稳定的策略学习。为了弥补现有基准的差距,我们还提供了 VLN-AVP 数据集和基准。它拥有 10 个高保真停车场景和 1,000 多个导航片段,是迄今为止车库场景数量最多的,也是首个地下停车场 VLN 标杆。大量实验表明,在模拟中,我们的方法与VLN方法相比成功率提高了25%以上,与其他自动驾驶方法相比成功率提高了15%以上。此外,它在实际车辆实验中取得了领先的成功率,证明了其实际可行性。