我在哪里?通过视觉语言模型进行语义地图对齐以实现多模态定位
Where Am I? Semantic Map Grounding via Vision-Language Models for Multi-Modal Localization
摘要
我们通过将其重新定义为语义推理任务而不是几何估计问题来解决 GPS 拒绝的室内环境中的机器人定位问题。受人类如何使用对象级线索和标记地图进行定位的启发,我们询问视觉语言模型是否可以在给定前置摄像头图像、极坐标激光雷达扫描和自上而下的语义网格图的情况下推断机器人姿势。我们使用 LoRA 微调 Qwen2.5-VL-7B,并附加一个轻量级回归头,直接从最终隐藏状态预测连续姿势坐标(x、y、theta),绕过文本生成。训练使用复合位置和方向损失以及课程学习,在包含 120,112 个样本和 527 个场景的自定义 Gazebo 数据集上进行。在 18,017 个样本的分布测试集上,该模型的位置精度为 98.23%,方向精度为 98.00%,全位姿精度为 96.75%,每个样本在 0.62 s 时的平均位置误差为 0.11 m,平均方向误差为 5.7 度。在 7 个未见过的物体类别上,位置准确度仅下降 7.2 个百分点,达到 90.99%,支持语义空间推理而不是外观记忆。对于不完整的地图,微调 将性能恢复到 93.72% 的位置精度,显示出对陈旧或部分地图信息的适应性。两次消融凸显了跨模式的互补性。如果没有 LiDAR,仅使用摄像头和地图输入,位置精度仍为 95.06%,仅比整个系统低 3.2 个百分点。然而,当摄像头在面向墙壁的视图中看不到可见物体时,LiDAR 的位置精度保持为 92.33%,而当 LiDAR 和可见物体均不可用时,位置精度为 70.74%。这表明当相机语义不可用时,LiDAR 成为主要定位信号,并在遮挡或稀疏布局下提供可靠的后备。