论文
P3T:具有增强的 3D 视觉语言模型泛化能力的原型点级提示调整
P3T: Prototypical Point-level Prompt Tuning with Enhanced Generalization for 3D Vision-Language Models
摘要
随着 3D 点云领域中针对各种实际应用的预训练模型的兴起,使它们适应下游任务变得越来越重要。然而,传统的完整 微调 方法计算成本昂贵且存储密集。尽管即时调优已成为一种有效的替代方案,但它经常会出现过度拟合,从而损害泛化能力。为了解决这个问题,我们提出了原型点级提示调整(P$^3$T),这是一种为预训练的 3D 视觉语言模型(VLM)设计的参数有效的提示调整方法。 P$^3$T 由两个组件组成:1) \textit{Point Prompter},它为输入点云生成实例感知的点级提示;2) \textit{Text Prompter},它在输入文本中使用可学习的提示,而不是手工制作的提示。由于两个提示器都直接对输入数据进行操作,因此 P$^3$T 可以在不牺牲通用性的情况下实现 3D VLM 的特定于任务的适应。此外,为了增强嵌入空间对齐(这是 微调 3D VLM 的关键),我们引入了一种原型损失来减少类别内方差。大量实验表明,我们的方法在分类和小样本学习方面匹配或优于完整的 微调,并进一步在跨数据集设置中的数据转移下表现出强大的泛化能力。代码可在 \textcolor{violet}{https://github.com/gyjung975/P3T} 获取。