论文
迈向 3D 场景理解的基础模型:点云的实例感知自监督学习
Towards Foundation Models for 3D Scene Understanding: Instance-Aware Self-Supervised Learning for Point Clouds
摘要
点云自监督学习 (SSL) 的最新进展显着改善了无需人工注释的 3D 场景理解。现有方法通过增强增强视图之间的特征一致性或通过屏蔽场景建模来强调语义意识。然而,所得的表示迁移到实例本地化的效果很差,并且通常需要完全微调才能获得强大的性能。实例感知是 3D 感知的基本组成部分,因此弥合这一差距对于发展支持 3D 数据上所有下游任务的真正 3D 基础模型至关重要。在这项工作中,我们介绍了 PointINS,这是一种面向实例的自监督框架,可通过几何感知学习丰富点云表示。 PointINS 采用正交偏移分支来共同学习高级语义理解和几何推理,从而产生实例感知。我们确定了鲁棒实例定位所必需的两个一致属性,并将它们制定为互补的正则化策略:偏移分布正则化(ODR),它将预测的偏移量与经验观察到的几何先验对齐;以及空间聚类正则化(SCR),它通过使用伪实例掩码正则化偏移量来强制局部一致性。通过对五个数据集的广泛实验,PointINS 室内实例分割的 mAP 平均提高了 +3.5%,室外全景分割的 PQ 平均提高了 +4.1%,为可扩展的 3D 基础模型铺平了道路。