论文
通过 Visual Foundation 模型中的 蒸馏 进行室内逐帧激光雷达语义分割的可行性
Feasibility of Indoor Frame-Wise Lidar Semantic Segmentation via Distillation from Visual Foundation Model
摘要
室内激光雷达扫描的逐帧语义分割是迈向更高级别 3D 场景理解和地图应用的基本一步。然而,获取逐帧 真值 来训练深度学习模型既昂贵又耗时。对于图像来说,这一挑战主要通过分割图像帧的视觉基础模型(VFM)来解决。相同的 VFM 可用于通过 2D 到 3D 蒸馏 管道训练激光雷达扫描帧分割模型。这种蒸馏的成功已经在自动驾驶场景中得到体现,但尚未在室内场景中得到体现。在这里,我们通过将每次激光雷达扫描与 VFM 处理的相机图像耦合,以逐帧 蒸馏 方式研究在室内场景中重复这一成功的可行性。评估是使用室内 SLAM 数据集完成的,其中伪标签用于下游评估。此外,还提供了一个小型手动注释激光雷达数据集用于验证,因为没有其他具有语义的激光雷达逐帧室内数据集。结果表明,蒸馏模型在伪标签评估下达到了高达 56% mIoU,在真实标签评估下达到了约 36% mIoU,证明了跨模态 蒸馏 在无需手动注释的情况下用于室内激光雷达语义分割的可行性。