论文

GeoMetric:将公制地理结构注入全球图像地理定位

GeoMetric: Injecting Metric Geographic Structure into Worldwide Image Geo-Localization

应用与实践视觉感知与空间理解

摘要

全球图像地理定位旨在确定单个图像在地球上的哪个位置被捕获。然而,视觉上相似的场景可能相距数千公里,因此主要通过外观进行定位的方法经常将远处的相似场景误认为是真实位置。我们将这种失败归因于结构性原因:在现有方法中,GPS 坐标仅充当训练监督,位置之间的距离关系从未进入学习表示。为了解决这个问题,我们提出了 GeoMetric,一种基于检索的框架,它对 GPS 坐标进行相关编码而不是孤立编码,将位置之间的距离结构注入表示学习和推理中。 GeoMetric 包含三个组件:(1) 基于 Transformer 的 GPS 编码器,具有距离感知位置注意功能,可通过大圆接近度调节样本间聚合; (2) 三模态对比目标,将图像、地理文本描述和 GPS 嵌入排列在统一的空间中; (3) 检索增强推理阶段,为大型多模态模型 (LMM) 提供对比候选上下文,以进行基于检索证据的坐标推理。在 IM2GPS、IM2GPS3k、YFCC4k 和 YFCC26k 上进行的大量实验表明,GeoMetric 始终优于最先进的方法,将街道级精度(1 公里内)分别提高了 1.5%、0.9%、6.9% 和 2.5%。受控消融证实增益源自提议的地理编码而不是任何特定的 LMM。