论文

TOLiD:通过 蒸馏 的词元提升,弥合视觉基础模型与 LiDAR 预训练的架构差距

TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation

摘要

从视觉基础模型 (VFM) 到 LiDAR 主干的跨模态 蒸馏 最近作为一种自监督预训练策略出现,可减少 3D 场景理解对密集逐点注释的依赖。然而,现有的 蒸馏 管道通常将 VFM 视为冻结特征源,并训练异构 3D 主干来匹配固定图像嵌入,迫使学生弥合密集 ViT 词元表示和稀疏 3D 编码器之间的模态差距和跨架构差距。我们提出了 TOLiD,一种用于 LiDAR 表示学习的自监督预训练方法,通过将 LiDAR 主干与从冻结的 VFM 教师初始化的学生 Vision Transformer (ViT) 耦合并对兼容的补丁词元表示应用监督来解决这一差距。 TOLiD 使用视锥体池化和视锥体注意力机制将每个图像块视锥体内的点特征集转换为标记,并使用可见性掩蔽执行 词元级 蒸馏。对于仅 LiDAR 的部署,我们使用掩模双线性采样将词元特征提升回每点表示,以避免具有有限 LiDAR 点的补丁。我们在五个异构 LiDAR 数据集和四个跨传感器适应对上广泛评估 TOLiD,证明了冷冻骨干和轻型头部的改进传输。