论文
Geo$^\textbf{2}$:几何引导的跨视图地理定位和图像合成
Geo$^\textbf{2}$: Geometry-Guided Cross-view Geo-Localization and Image Synthesis
摘要
跨视图地理空间学习包括两个重要任务:跨视图地理定位(CVGL)和跨视图图像合成(CVIS),这两者都依赖于建立地面视图和鸟瞰图之间的几何对应关系。最近的几何基础模型 (GFM) 在从图像中提取通用 3D 几何特征方面表现出了强大的能力,但它们在跨视图地理空间任务中的潜力仍未得到充分开发。在这项工作中,我们提出了 Geo^2,一个统一的框架,利用 GFM(例如 VGGT)的几何先验来联合执行地理空间任务、CVGL 和双向 CVIS。尽管 GFM 具有 3D 重建能力,但由于地面图像和航空图像之间的视点差距较大,将其直接应用于 CVGL 和 CVIS 仍然具有挑战性。我们提出了 GeoMap,它将地面和空中特征嵌入到共享的 3D 感知潜在空间中,有效减少定位的跨视图差异。这种共享的潜在空间自然地桥接了两个方向的跨视图图像合成。为了利用这一点,我们提出了 GeoFlow,一种以几何感知潜在嵌入为条件的流匹配模型。我们进一步引入一致性损失来强制两个合成方向之间的潜在对齐,确保双向一致性。在 CVUSA、CVACT 和 VIGOR 等标准基准上进行的大量实验表明,Geo^2 在定位和合成方面均实现了最先进的性能,突出了 3D 几何先验对于跨视图地理空间学习的有效性。