论文

LoRetta:全球遥感稠密图像匹配的基础模型与大规模数据集

LoRetta: A Foundation Model and Extensive Dataset for Global-Scale Remote Sensing Dense Image Matching

应用与实践视觉感知与空间理解

摘要

密集图像匹配建立了像素级对应关系,并支撑了计算机视觉和摄影测量中的广泛应用。然而,将密集匹配扩展到全球尺度遥感仍然具有挑战性,因为图像对在采集时间、季节、视点、空间分辨率和土地覆盖状态方面可能有所不同。由此产生的大几何偏移、部分重叠和本质上不匹配的区域使得直接密集对应预测不可靠且低效。因此,我们将密集匹配重新表述为定位和配准:首先定位可匹配的重叠和仿射几何形状,然后细化对齐框架内的密集残差。基于这个公式,我们提出了 LoRetta,一种将可匹配感知仿射定位与引导密集配准相结合的基础模型。我们还推出了 LEVIR-GM,这是一种全球规模的多时态光学匹配基准,具有数据集本机可匹配性标签(103K 对齐、827K 增强对、六大洲、五年、0.5-1024 m 分辨率)。我们进一步建立了稀疏、半密集和密集匹配器的统一评估协议。在 LEVIR-GM 上,LoRetta 实现了 83.3% 的曲线下面积 (AUC),比最强基线 RoMa v2 提高了 1.6 个百分点,在 1 和 2 像素处正确关键点 (PCK) 的百分比提高了 6.5 和 8.2 个百分点,同时将推理延迟降低了 47.8%。宇航员到卫星和无人机到卫星地理定位实验进一步证明了其作为可重复使用的几何对准器的可转移性。