论文

VLM-GLoc:视觉语言模型增强蒙特卡罗定位,可在杂乱的准静态环境中实现鲁棒语义全局定位

VLM-GLoc: Vision-Language Model Enhanced Monte Carlo Localization for Robust Semantic Global Localization in Cluttered Quasi-Static Environments

摘要

杂货店、办公室、学校和医院等几何别名、准静态环境中的全球定位对移动机器人提出了重大挑战。具有平行通道和长尾产品分布的杂货店,以及具有椅子、桌子、显示器和门等重复家具的办公室和实验室,都是常见的室内环境的典型例子,这些环境呈现出几何甚至语义上的模糊性。传统方法要么依赖于不同的几何特征,要么依赖于特定领域的视觉管道,这些管道与长尾语义分布和瞬态视觉混乱作斗争。我们提出了 VLM-GLoc,一种分层语义蒙特卡罗定位 (MCL) 方法,它利用开放词汇视觉语言模型 (VLM) 作为统一的语义观察前端。我们假设 VLM 有三重好处:(1) 提取高度辨别性的富文本特征,(2) 模糊或动态对象的隐式质量过滤,以及 (3) 针对目标数据增强的持久性推理。我们引入了一种逆语义提议机制,该机制通过文本到地图检索来播种粒子。在两个具有不同特征的现实环境和两个不同的平台上进行评估:一个 3,500 平方英尺的杂货店(配有手机)和一个 3,700 平方英尺的实验室空间(配有四足动物),VLM-GLoc 分别实现了 70% 和 74% 的全球本地化成功率,大大优于传统的仅几何基准和特定领域的基准。