论文
利用基于视觉的点云地图先验进行基于摄像头的 3D 对象检测和在线矢量化高清测绘
Leveraging Vision-Based Point Cloud Map Priors for Camera-Based 3D Object Detection and Online Vectorized HD Mapping
摘要
基于摄像头的 3D 物体检测和在线矢量化高清地图为自动驾驶提供了紧凑的场景表示,但两者都依赖于精确的度量几何,并且仍然受到深度模糊性的限制。通过长期部署,重复遍历的观察结果可以累积到持久的点云先验中,从而提供超出当前观察结果的几何背景。然而,现有的显式点云先前方法依赖于基于 LiDAR 的地图构建,因此需要昂贵的 3D 测距传感器。我们提出了一个框架,该框架使用 Pi3X 根据之前的相机遍历构建静态点云先验图,并使用 DINOv3 特征增强每个点。在运行时,使用全局定位检索本地先验补丁,使用稀疏体素骨干进行编码,并与提升的多视图相机功能融合在鸟瞰图(BEV)中。然后,特定于任务的稀疏Transformer头根据融合表示来预测 3D 对象和矢量化地图元素。在 Argoverse 2 上,基于视觉的先验将强基线 CDS 从 0.287 提高到 0.299,矢量化映射 mAP 从 0.669 提高到 0.750。消融表明语义 DINOv3 特征对于矢量化映射特别重要。这些结果表明,视觉构建的几何语义先验为基于相机的感知提供了一种有效的长期场景记忆形式,无需激光雷达即可改进先验地图构建或在线推理的两项任务。