论文
自然环境中的几何条件视觉位置识别
Geometry-Conditioned Visual Place Recognition in Natural Environments
摘要
由于重复的植被、稀疏的独特地标以及遍历过程中的显着外观和视点变化,自然环境中的视觉地点识别(VPR)仍然具有挑战性。虽然对同一地点的视觉观察可能会发生很大变化,但其潜在的空间结构往往更加持久。我们通过深度感知蒸馏(DAD)利用这种互补的几何一致性,它在没有任何深度传感器的情况下,根据几何基础模型(GFM)推断的几何形状来调节预训练视觉基础模型(VFM)的词元表示。 DAD 没有将几何图形视为额外的输入模态,而是将图像对齐的深度投影到 VFM 标记空间中,并通过通道式几何条件选择性地调制视觉表示。两阶段的教师指导学习策略首先将几何条件表示锚定到预训练的外观空间,然后对其进行改进以进行位置辨别。在 WildCross 基准上进行评估,与仅匹配外观的基线相比,DAD 将平均序列间 Recall@1 从 61.41% 提高到 66.37%,将 Recall@5 从 65.86% 提高到 72.49%,在反向遍历和长期外观变化下收益最大。这些结果表明,当视觉外观变得不可靠时,GFM 导出的几何形状可以为 VPR 提供持久的结构先验。