论文
通过 3D 几何感知统一无人机跨视图地理定位
Unifying UAV Cross-View Geo-Localization via 3D Geometric Perception
摘要
由于倾斜无人机图像和正交卫星地图之间存在严重的几何差异,在 GNSS 拒绝环境中运行的无人机 (UAV) 的跨视图地理定位仍然具有挑战性。大多数现有方法通过位置检索和姿势估计的解耦管道来解决这个问题,隐式地将透视失真视为外观噪声而不是显式几何变换。在这项工作中,我们提出了一种几何感知的无人机地理定位框架,该框架对 3D 场景几何进行显式建模,以在单个推理管道中统一粗略位置识别和细粒度姿态估计。我们的方法使用基于视觉几何的 Transformer (VGGT) 从多视图无人机图像序列重建局部 3D 场景,并渲染虚拟鸟瞰图 (BEV) 表示,对无人机视角进行正射校正以与卫星图像对齐。该 BEV 充当几何中介,可实现强大的跨视图检索,并为准确的 3 自由度 (3-DoF) 姿态回归提供空间先验。为了有效地处理多个位置假设,我们引入了卫星注意块,它隔离每个卫星候选者和重建的无人机场景之间的交互,防止候选者之间的干扰,同时保持线性计算复杂性。此外,我们还发布了 University-1652 数据集的重新校准版本,具有精确的坐标注释和空间重叠分析,可以对端到端定位精度进行严格评估。对改进的 University-1652 基准和 SUES-200 进行的大量实验表明,我们的方法显着优于最先进的基线,实现了稳健的米级定位精度并提高了复杂城市环境中的泛化能力。