论文
ViCo3D:利用视觉基础模型增强基于 LiDAR 的协作 3D 对象检测
ViCo3D: Empowering LiDAR-based Collaborative 3D Object Detection with Vision Foundation Models
摘要
车联网 (V2X) 系统中基于 LiDAR 的协作 3D 感知通常依赖于跨代理融合鸟瞰 (BEV) 功能。然而,当前的 BEV 表示通常由从头开始训练的 LiDAR 主干提取,以几何为主导,并且缺乏一般语义先验,从本质上限制了特征级协作的有效性。与此同时,在大规模图像数据上预训练的视觉基础模型 (VFM) 表现出了学习 2D 任务的通用和信息丰富的视觉表示的强大能力,并且有潜力增强智能体 LiDAR BEV 表示以进行协作。尽管有这种潜力,但由于图像与点云模态之间存在巨大差距,使 VFM 适应基于 LiDAR 的 3D 检测仍然具有挑战性。为了弥补这一差距,我们提出了 ViCo3D,这是一种由 VFM 支持的协作 3D 对象检测框架。具体来说,ViCo3D从三个方面使VFM适应基于LiDAR的协作感知:首先,ViCo3D将点云作为三通道图像投影到BEV平面上,使DINOv2能够从LiDAR输入中提取BEV空间视觉特征。此外,为了有效地将这些 DINOv2 衍生特征与 LiDAR 几何特征集成,ViCo3D 在单代理编码器中引入了多尺度 BEV 融合模块。此外,ViCo3D采用以自我为中心的跨智能体融合策略来聚合来自多个智能体的互补信息。 DAIR-V2X 和 V2XSet 上的实验表明 ViCo3D 实现了最先进的 3D 检测性能。值得注意的是,与之前的 DAIR-V2X 方法相比,它的协作收益提高了 1.8 倍。该代码将公开以供将来调查。