论文
通过视觉基础模型实现稳健的多模态 3D 物体检测
Towards robust multimodal 3D object detection via visual foundation models
摘要
多模态 3D 物体检测是自动驾驶中稳健感知的基础,因为它集成了来自 LiDAR 和摄像头传感器的补充信息。然而,现有的方法通常无法在传感器噪声、恶劣天气和环境变化引起的分布外(OOD)损坏的情况下保持鲁棒性。为了解决这个问题,我们提出了 RoboDistill,这是一个强大且可泛化的多模态 3D 对象检测框架,它利用视觉基础模型 (VFM),例如分段任意模型 (SAM)。首先,我们介绍 SAM-AD,这是一种特定领域的预训练策略,可对自动驾驶图像上的 SAM 进行微调,以提取具有丰富语义信息的特征表示。其次,我们设计了 AD 特征金字塔网络 (AD-FPN),以在多个尺度上细化和上采样 SAM 特征,以便与 LiDAR 特征无缝融合。第三,我们开发了深度引导小波注意力(DGWA)模块,该模块可以抑制高频传感器噪声,同时保留关键的上下文信息。最后,我们介绍了 KD Fusion,其中预训练的 SAM-AD 作为老师,将高质量的视觉知识提炼到轻量级点云网络中,从而提高噪声条件下的鲁棒性。跨 27 个具有挑战性的 OOD 损坏设置的广泛实验表明,相对于代表性的最先进方法,RoboDistill 通常可提供更强或有竞争力的检测性能和稳健性。这项工作弥合了 VFM 和 3D 物体检测之间的差距,并为现实世界的自动驾驶应用提供了强大的多模态感知。