论文

CVSD-Reg:用于稳健 LiDAR 配准的跨模态视觉语义先验 蒸馏

CVSD-Reg: Cross-Modal Visual Semantic Prior Distillation for Robust LiDAR Registration

摘要

基于学习的全局点云配准已经取得了显着的进展,但其对几何表示的依赖使得现有方法对点密度、扫描模式、视点和传感器特性的变化敏感。我们提出了 CVSD-Reg,这是一个强大的全局 LiDAR 配准框架,可将视觉语义先验从视觉基础模型中提炼为 LiDAR 表示。在第 1 阶段,Point Transformer V3 学生通过对比 蒸馏 和球流形对齐向冻结的 DINOv2 教师学习,这保留了教师嵌入空间的超球面几何形状。自监督的 InfoNCE 一致性和软 $\mathrm{SE}(3)$ 不变性进一步鼓励视点鲁棒描述符。在第 2 阶段,通过对应学习、密度感知点丢失增强和端到端姿态优化,将蒸馏后的表示适应于配准。通过单个检查点,CVSD-Reg 可以推广到单传感器和零样本跨传感器场景,无需特定于传感器的适应,并且在推理时保持完全无相机。在 KITTI、nuScenes 和 HeLiPR 上,CVSD-Reg 分别实现了 97.7$\%$、99.0$\%$ 和 99.3$\%$ 的严格成功率 (SR@0.5\,m/$1^\circ$),包括稀疏 16 光束 Velodyne 扫描上的 97.3$\%$。它的性能比最先进的几何配准方法高出 44.0 个百分点,而无需相机输入或事后 ICP 细化。