论文
GAAT:用于多模态无人机感知的几何感知对准 Transformer
GAAT: Geometry-Aware Alignment Transformer for Multimodal UAV Perception
摘要
无人机 (UAV) 多模态感知集成了可见光 (RGB)、红外 (IR)、合成孔径雷达 (SAR) 和深度传感器,可实现不同条件下的场景理解。然而,光学、分辨率和安装方面的差异常常限制实际系统的全局或图像中心对准。标记化后,视差、平台运动和镜头畸变可以跨模态移动相应的块中心,削弱密集对比学习和跨模态融合所假设的空间对应关系。我们提出了 GAAT(几何感知对齐 Transformer),这是一种对齐优先的预训练模型,可在跨模式交互之前估计局部对应可靠性。 GAAT 引入了syncPATC,它可以在同步视图转换下学习补丁中心一致性,而无需对应注释。它发出几何先验,包括词元和查询置信度、查询中心和子词元偏移量,这些先验可以在残余未对齐情况下识别可靠的本地锚点。在这些先验的指导下,MG-Sparse-MMA 在 top-K_s 可靠区域上执行查询介导的稀疏融合,用几何校准的局部更新替换密集的全补丁交互。 RA-QCGCL 通过可靠的补丁到补丁、补丁到查询和查询到查询对比分支,将预训练监督与稀疏查询瓶颈结合起来。我们引入了 UAVMeta 和 StateBench,它们提供了从平台遥测和图像统计中得出的四种捕获状态分数:相机可靠性、观测规模、视点稳定性和飞行操纵复杂性。六个下游任务的广泛实验证明了其始终如一的卓越传输性能,将 GAAT 确立为最先进的无人机感知多模态基础模型。 StateBench 进一步实现了对现实世界采集条件的系统诊断。