论文

S$^3$Geo:跨视图地理定位的结构语义协同学习

S$^3$Geo: Structure-Semantic Synergistic Learning for Cross-View Geo-Localization

应用与实践模型优化蒸馏视觉感知与空间理解

摘要

跨视图地理定位 (CVGL) 旨在通过匹配从不同视点(例如无人机和卫星视图)捕获的图像来估计地理位置。现有的方法主要依赖于视觉表示,但往往无法联合建模细粒度的结构对应和语义先验,使得它们容易在视觉相似但语义不同的区域之间产生混淆,从而限制了大视点变化下的鲁棒性。为了应对这些挑战,我们提出了 \textbf{S$^3$Geo},一种用于跨视图匹配的结构语义协同学习框架。具体来说,我们首先引入解耦查询池(DQP)模块,从密集的标记中提取一组紧凑的区域感知特征,从而实现局部结构模式的显式建模。然后,我们设计了一个查询级对比学习方案,该方案具有基于最佳传输(OT)的公式,以在跨视图空间错位下建立软对应。此外,我们结合了冻结 CLIP 教师的语义知识蒸馏(SKD)策略来迁移 语义先验和关系结构,从而改善对硬否定的区分。通过协同操作,语义先验提供了强大的上下文过滤,指导结构模块建立精确的空间对齐。在 University-1652 和 SUES-200 数据集上的实验表明,\textbf{S$^3$Geo} 在不增加推理复杂性的情况下始终优于最先进的方法,验证了 CVGL 联合建模结构和语义信息的有效性。