论文

BGG:通过视觉基础模型适应地理定位来弥合跨视图图像之间的几何间隙

BGG: Bridging the Geometric Gap between Cross-View images by Vision Foundation Model Adaptation for Geo-Localization

模型训练参数高效训练

摘要

跨视图图像(例如无人机和卫星视图)之间的几何差异显着增加了跨视图地理定位(CVGL)的挑战,CVGL 旨在通过图像检索来获取图像的地理定位。为了进一步增强 CVGL 性能,本文提出了一种参数有效的自适应框架,用于基于视觉基础模型(VFM)(例如 DINOv3)弥合图像之间的几何间隙,称为 BGG。 BGG不仅有效地利用了VFM的通用视觉表示并从跨视图图像中捕获鲁棒且一致的特征,而且还利用了VFM的泛化能力,显着提高了CVGL的性能。它主要包含多粒度特征增强适配器(MFEA)和频率感知结构聚合(FASA)模块。具体来说,MFEA通过多级扩张卷积增强了特征的尺度适应性和视点鲁棒性,以较小的训练成本有效地弥合了跨视图几何差距。此外,考虑到 [CLS] 词元缺乏精确图像检索和定位的空间细节,FASA 模块在频域中调制补丁词元并执行自适应聚合以增强局部结构特征。最后,BGG 将增强的局部特征与 [CLS] 标记融合,以获得更准确的 CVGL。在 University-1652 和 SUES-200 数据集上进行的大量实验表明,BGG 比其他方法具有显着优势,并以较低的训练成本实现了最先进的定位性能。