论文
非合作无人机基于 ViT 的合成到真实姿态估计
Synthetic-to-Real ViT-Based Pose Estimation of a Noncooperative UAV
摘要
根据图像对非合作无人机 (UAV) 进行远程姿态估计至关重要,因为它们无法提前受到影响或检测。基于深度学习的方法提供了一个有前途的解决方案;然而,它们的发展受到获取具有准确姿势标签的大规模现实世界数据集的成本和难度的限制。合成图像提供了一种替代方案,但在合成数据上训练的模型必须克服合成与真实领域之间的差距,才能推广到现实世界的图像。这项工作研究了基于 Vision Transformer (ViT) 的单目无人机姿态估计模型的固有合成到真实泛化能力。所提出的方法采用自我监督的 DINOv2 骨干模型,专门针对标记的合成图像进行训练,同时在标记的真实世界图像上进行评估。在训练和推理过程中结合了姿势模糊感知策略,以解决因三维目标投影到二维图像平面上以及目标对称性而产生的模糊性。在推理过程中进一步集成 $α$-$β$ 过滤器以改进姿态估计。为了根据操作要求评估模型,使用包含 77,077 张标记无人机图像的真实数据集,根据过滤前后的平均角度误差 (MAE) 和推理时间对其进行评估。在过滤之前,模型实现了 $19.18^{\circ}$ 的 MAE 和 $13.25$ ms 的推理时间,而过滤之后,这些值分别为 $8.74^{\circ}$ 和 $13.42$ ms。