论文

只需放大:通过自回归缩放进行跨视图地理定位

Just Zoom In: Cross-View Geo-Localization via Autoregressive Zooming

应用与实践视觉感知与空间理解

摘要

跨视图地理定位 (CVGL) 通过将街景图像与地理参考俯视图像进行匹配来估计摄像机的位置,从而实现 GPS 拒绝的定位和导航。现有方法几乎普遍将 CVGL 表述为对比训练的嵌入空间中的图像检索问题。这将性能与大批量和硬负挖掘联系在一起,并且忽略了地图的几何结构以及街景和俯视图像之间的覆盖范围不匹配。特别是,从街景中可见的显着地标可能会落在固定卫星作物范围之外,从而使检索目标模糊不清并限制地图上的显式空间推断。我们提出了 Just Zoom In,这是一种替代方案,通过在城市规模的俯视图上进行自回归缩放来执行 CVGL。该模型从粗略的卫星视图开始,采取一系列简短的放大决策,以目标分辨率选择终端卫星小区,而不会产生对比损失或硬负挖掘。我们进一步引入了一个现实的基准,其中包含反映真实捕获条件的众包街景和高分辨率卫星图像。在此基准测试中,Just Zoom In 实现了最先进的性能,与最强对比检索基线相比,50 m 内的 Recall@1 提高了 5.5%,100 m 内的 Recall@1 提高了 9.6%。这些结果证明了顺序从粗到细的空间推理对于跨视图地理定位的有效性。