论文

用于 3D 场景理解的分区不变调整

Partition-Invariant Tuning for 3D Scene Understanding

模型训练参数高效训练

摘要

由于几何形状和空间布局的不同,场景级点云理解仍然具有挑战性。虽然预训练的 3D 点云基础模型 (PFM) 具有很强的可移植性,但完全微调 (FFT) 会产生大量的计算和存储成本。参数高效微调(PEFT)提供了一种有前途的替代方案,但现有的 PEFT 方法主要关注对象级点云,而忽略了大规模场景中序列化引起的分区变化。为了解决这个问题,我们提出了 PointPiT,一种用于场景级点云的分区不变调整框架。具体来说,场景感知结构适配器(SSA)将局部几何图案与全局场景上下文集成,以减轻分区引起的表示变化。此外,梯度子空间优化(GSO)选择信息丰富且分区稳定的更新方向,在优化期间抑制分区相关的变化。跨多个场景级基准的大量实验表明,PointPiT 使用不到 1% 的主干参数实现了完全微调的竞争性甚至优越性能,同时在代表性 PEFT 方法中实现了一致的最先进性能。