论文

GAPrompt++:3D 视觉模型的多粒度几何感知点云提示

GAPrompt++: Multi-Granular Geometry-Aware Point Cloud Prompt for 3D Vision Model

模型训练参数高效训练

摘要

预训练的 3D 视觉模型具有相当先进的点云分析,但通过全面微调使其适应下游任务的计算成本很高且存储密集型。参数高效微调(PEFT)通过降低适应成本和存储负担提供了一种有前途的替代方案。然而,现有的基于提示的方法忽略了点云的内在几何结构,从而限制了它们的适应能力。这种限制源于它们无法对细粒度的几何线索和粗粒度的结构语义进行编码,并且无法通过模型层次结构有效地传播此类信息。为了应对这些挑战,我们提出了 GAPrompt++,一种多粒度几何感知提示方法,为高效的 3D 任务适应提供更丰富的几何指导。具体来说,我们引入了一个Point Shift Prompter,它可以提取不同尺度的多粒度几何特征,从而在适应过程中实现特定于实例的几何调整。接下来,关键点提示器自适应地生成点级提示,以突出显示局部几何显着性和细粒度结构细节。此外,即时传播机制将这些多粒度几何线索注入到整个特征提取层次结构中,从而增强了捕获基本几何特征的能力。大量实验表明,GAPrompt++ 在基于提示的 PEFT 方法中实现了最先进的性能,甚至超越了跨不同基准的完全微调,同时需要少于 2% 的可训练参数。此外,为了解决现有评估数据集的饱和问题,我们构建了两个更具挑战性的基准,这些基准源自3D高斯泼溅和多视图立体重建,提供多样化和真实的点云场景以促进未来的研究。