论文

超越 2D 匹配:用于几何感知跨视图对象地理定位的统一单级框架

Beyond 2D Matching: A Unified Single-Stage Framework for Geometry-Aware Cross-View Object Geo-Localization

应用与实践视觉感知与空间理解

摘要

跨视图对象地理定位 (CVOGL) 旨在从地理标记参考图像(例如卫星)内的查询视图(例如地面或无人机)定位目标对象。现有方法严重依赖 2D 外观匹配,并受到缺乏几何元数据、多样化提示和标准视场图像的有限数据集的限制。为了解决这些相互交织的挑战,我们首先引入 \dataset,这是一个大规模、高保真建筑数据集,包含超过 220,000 个地面卫星和无人机卫星对。它提供多模式提示(点、框、掩模)和相机姿势,以实现灵活的目标参考和显式空间建模。此外,我们提出了一种新颖的单阶段几何感知地理定位框架(GAGeo),该框架建立在排列等变 3D 基础模型 $π^3$ 之上。通过无缝集成视觉特征、参考提示和可学习的任务标记,我们的模型适应了继承的 3D 先验,在单个前向传递中联合预测边界框、分割掩模和相机姿势。此外,我们引入了一种对比损失,利用卫星视图作为通用锚点,隐式对齐地面和无人机表示,以实现零样本地面到无人机定位,而无需三元组训练数据。大量的实验表明,我们的方法明显优于最先进的方法,在未见过的场景和新颖的交叉视图设置中表现出卓越的泛化能力。