论文
SpaCeFormer:快速无提案开放词汇 3D 实例分割
SpaCeFormer: Fast Proposal-Free Open-Vocabulary 3D Instance Segmentation
摘要
开放词汇 3D 实例分割是机器人和 AR/VR 的核心功能,但之前的方法将一个瓶颈换成了另一个瓶颈:多级 2D+3D 管道在每个场景数百秒内聚合基础模型输出,而伪标记端到端方法依赖于碎片掩码和外部区域建议。我们推出了 SpaCeFormer,这是一种无提案空间曲线 Transformer,在标准基准测试中每个场景的运行时间为 0.12--0.30 秒,比多级 2D+3D 管道快 2--3 个数量级。我们将其与 SpaCeFormer-3M 配对,后者是通过多视图掩模聚类和多视图 VLM 图像描述构建的最大的开放词汇 3D 实例分割数据集(来自 7.4K 场景的 604K 实例的 3.0M 多视图一致图像描述);与之前的单视图管道相比,它的掩模召回率提高了 21 倍(54.3% vs 2.5%,IoU>0.5)。 SpaCeFormer 将空间窗口注意力与莫顿曲线序列化相结合以实现空间相干特征,并使用 RoPE 增强解码器直接从学习的查询中预测实例掩码,无需外部建议。在 ScanNet200 上,我们实现了 11.1 的零样本 mAP,比之前最好的无提议方法提高了 2.8$\times$;在 ScanNet++ 和 Replica 上,我们达到了 22.9 和 24.1 mAP,超越了所有先前的方法,包括使用多视图 2D 输入的方法。