论文
从视频基础模型引导 4D LiDAR 注释工具
Bootstrapping a 4D LiDAR Annotation Tool from Video Foundation Models
摘要
4D LiDAR 分割的进展受到数据的瓶颈。在稀疏点云序列中分配时间一致的标签成本高昂且难以扩展,并且每个新任务或领域往往需要新的密集注释。这就引发了一个简单的问题:是否可以自动生成高质量的激光雷达训练数据,而无需任何人工标记。为此,我们引入了 LiDAR-SAM2,该框架将 2D 视频基础模型 SAM2 转变为 4D LiDAR 领域的可扩展监督源。在数据方面,它通过多视图投影和时空聚合,从 SAM2 视频掩模自动生成时间相干的 LiDAR 级标签。在建模方面,定制的模态接口和两阶段学习目标使 SAM2 的视频分割内核适应时空 LiDAR 结构,以便每个对象单击一次即可在整个序列中产生一致的掩模轨迹。 LiDAR-SAM2 在没有人类 LiDAR 注释的情况下进行训练,在 SemanticKITTI 上生成语义和全景标签,仅从几个点接近完整人类注释的质量,并且在这些标签上训练的模型接近完整 真值 监督的性能。这使得 LiDAR-SAM2 成为一种可扩展的标记工具,可大大减轻 3D 和 4D 场景理解的注释负担。