论文
无需训练 通用少样本基准上的开放词汇 3D 点云分割
Training-Free Open-Vocabulary 3D Point-Cloud Segmentation on the Generalized Few-Shot Benchmark
摘要
广义少镜头 3D 点云分割 (GFS-PCS) 要求模型将场景分割为训练时看到的许多基类和一组新类。最先进的技术通过将密集但嘈杂的 3D 视觉语言先验与少量镜头支持相协调来达到新颖的类别,但它通过基础 3D 标签、每集训练和支持注释本身来为此付出代价。我们问,如果没有这些条件,同样的协调能走多远:没有训练,没有 3D 标签,甚至没有少数镜头的支持。我们将冻结的 3D 视觉语言模型 (RegionPLC) 作为密集先验与冻结的可提示概念分割器 (SAM3) 配对,由纯粹的新颖类名称提示并从提出的 RGB 视图中提取,并通过跨视图一致性来协调两者:只有当有足够多的观点一致时,一个点才变得新颖。在 ScanNet200 GFS-PCS 基准测试中,这种完全 无需训练 开放词汇管道比 无需训练 密集先验将新颖的 mIoU 提高了 +2.6,同时将基本精度保持在 0.5 以内,并将新颖类差距的三分之一 (33%) 恢复到使用更多监督的训练有素的现有技术水平。我们进一步表明,将少样本支持作为融合门和原型密集分类器注入管道中,不会增加任何超过一致性的内容,实际上会通过分类器降低一致性,这就是该方法根本不需要支持的原因。在更难的 ScanNet++ 基准上,稠密先验在新类上要弱得多,相同的管道以 1.7 的基本成本将新 mIoU 几乎翻倍(+15.7,从 16.2 到 31.9),将调和平均值从 21.5 提升到 31.1