论文

M3GA-Wild:森林中多模态多会话地对空地点识别的大规模数据集和基准

M3GA-Wild: A Large-Scale Dataset and Benchmark for Multi-Modal Multi-session Ground-to-Aerial Place Recognition in Forests

模型评测基准与评测资源

摘要

我们推出了 M3GA-Wild,这是森林中多模式、多会话地对空地点识别的第一个基准。 M3GA-Wild 统一并扩展了现有的森林定位数据集,提供了一个整体基准,包括来自跨越 36 公里地面遍历的同步 RGB 图像和 LiDAR、覆盖 370 公顷的对齐高分辨率航空图像和多高度 LiDAR,以及用于精确评估的精确地理参考 6-DoF 位姿。 M3GA-Wild 可捕捉具有不同视点、遮挡和环境条件的多样化森林场景,从而能够对视觉、LiDAR、跨模态和多模态方法进行系统评估。基线实验表明,在严重的视点差异下,基于激光雷达的方法显着优于仅视觉方法,而当前的多模态融合策略由于跨模态对齐较差,收益有限。通过将航空 RGB 图像与地理参考航空 LiDAR 配对,M3GA-Wild 还能够评估单目深度估计的基础模型,作为森林图像 3D 几何的廉价来源,初步实验揭示了当前方法的不足。这些结果凸显了跨平台本地化的关键挑战,包括模式错位和严重的领域差距。 M3GA-Wild 建立了一个新的基准,以支持非结构化自然环境中稳健的多模式定位和长期自治的研究。数据集和代码将在接受后提供。