论文

打破似曾相识:通过视觉语言推理对视觉位置识别进行独立审核

Breaking Déjà Vu: Independent Auditing of Visual Place Recognition through Vision-Language Reasoning

模型推理推理验证与自校正

摘要

视觉地点识别 (VPR) 是机器人应用中精确定位和长期自主导航的关键推动者,例如用于同步定位和建图 (SLAM) 的闭环检测。然而,现实世界的 VPR 部署依赖于选择平衡精度和召回率的图像匹配阈值。这些阈值通常使用标记的验证数据进行调整,并在部署期间固定,这使得它们在 真值 不可用的环境变化下变得不可靠。这在安全关键型机器人技术中尤其成问题,其中接受错误的闭环可能会破坏估计的轨迹和地图。在这项工作中,我们引入了视觉位置识别审核,这是一个独立的检索后验证框架,它利用视觉语言模型(VLM)通过对查询和候选图像联合推理来评估检索到的匹配。与传统的验证方法不同,我们的方法执行实例级验证,不需要特定于体系结构的置信度测量、数据集相关的阈值或部署环境的先验知识。我们使用五种最先进的 VPR 方法和四种 VLM 在六个基准数据集上评估我们的方法。结果表明,与最先进的方法相比,基于 VLM 的审核将召回率@1 平均提高了 13.6%,同时将错误接受率降低至 12%,保持精度高于 95%,覆盖率高于 75%。