论文

HilDA:具有扩散功能的分层 蒸馏,用于推进自监督 LiDAR 预训练

HilDA: Hierarchical Distillation with Diffusion for Advancing Self-Supervised LiDAR Pre-training

摘要

利用相机到 LiDAR 知识蒸馏 的视觉基础模型 (VFM) 提供了一种有前途的解决方案,解决了表示现实世界自动驾驶 (AD) 巨大的几何和运动学多样性所需的注释数据的稀缺问题。然而,当前的方法通常将 VFM 视为黑盒教师,完全依赖于帧方面的特征相似性。因此,他们没有充分利用教师的分层语义结构和全局上下文,以及激光雷达序列固有的丰富时空信息。我们提出了 HilDA,这是一种用于 LiDAR 主干的自监督预训练框架,可以更好地捕获驾驶任务所需的语义内容和几何位置。 HilDA 结合了分层 蒸馏(包括用于渐进语义对齐的多层 蒸馏 和用于场景级语义的全局上下文 蒸馏),以及促进时空一致性的时间占用扩散目标。使用 HilDA 预训练的模型在跨模式 蒸馏 基准上实现了最先进的结果,并且在 3D 对象检测、场景流和语义占用预测方面优于通过先前的 蒸馏 方法训练的模型。代码位于:https://maxiuw.github.io/hilda。