论文

Lang3DSeg:使用点转换器进行无注释开放词汇 3D 分割

Lang3DSeg: Annotation-Free Open-Vocabulary 3D Segmentation with Point Transformers

摘要

准确的 3D 语义感知对于安全自主导航至关重要。然而,有监督的 LiDAR 分割仍然与封闭的分类法和逐点手动注释的成本相关。开放词汇方法通过将 2D 视觉语言模型的输出投影到 LiDAR 上并将其提炼到 3D 网络中来避免这种成本。这些方法几乎完全依赖于基于体素的稀疏卷积,而点Transformer迄今为止仅限于 3D 数据密集且有界的室内环境。我们提出了 Lang3DSeg,它建立了一个点Transformer作为户外 3D LiDAR 的无注释开放词汇分割的骨干,并且从头开始训练,无需几何预训练。这种训练范例需要解决 2D 到 3D 标签投影中的固有噪声;具体来说,朴素投影经常遭受深度模糊,其中对象后面的点被错误地分配了其语义标签。因此,我们使用显式的类优先级规则来合成掩模,并在其深度分布的第一个间隙处截断每个投影实例,直接纠正投影误差,而不是对注册序列进行平均。 Lang3DSeg 在 nuScenes 验证上达到 52.8% mIoU,在 SemanticKITTI 上达到 41.4%,这是两个基准测试中已发布的无注释方法中最高的。每个 3D 语义分割都在一次 LiDAR 扫描上进行,推理实时运行,无需运行视觉语言模型。