论文

利用语义地图进行城市规模的跨视图定位

Leveraging Semantic Maps for City-Scale Cross-View Localization

应用与实践视觉感知与空间理解

摘要

我们希望机器人能够根据常用的先前数据在以前未去过的环境中进行本地化。 OpenStreetMap 提供的丰富语义数据在此任务中非常有用。然而,现有的方法要么忽略这种语义信息,直接匹配全景图和俯视图像,要么显着压缩语义信息,使用一小组固定类别。为了利用这种丰富的语义信息,需要克服两个挑战。首先,需要从机器人的自我中心观察中提取有用的语义信息。其次,观察到的信息必须快速与大型先验语义图(例如,高达 628 km^2)相关联。我们表明,VLM 可以有效地从全景图中提取相关地标,并识别这些地标与先前高架地标之间的可行对应关系。然而,随着映射地标数量的增加,使用 VLM 来提出所有对应关系的扩展效果很差。相反,我们建议从 VLM 中提取一个轻量级匹配器,该匹配器计算映射中所有实体的对应关系。我们使用此输出来形成观察可能性,该观察可能性随着时间的推移与贝叶斯滤波器融合,以创建姿势估计的时间序列。为了支持对利用语义信息的泛化交叉视图方法的进一步研究,我们发布了跨越十一个环境的提取语义和评估轨迹的数据集,包括我们在暴风雪和波士顿夜间收集的全景图。我们展示了我们的方法,该方法根据单个城市的晴天数据进行训练,概括了位置、照明、天气和其他挑战。代码和数据集可在 https://efahnestock.github.io/loci/ 获取。