论文
细化然后融合:具有优先级细化和多模态知识融合的免训练 3D 点云自适应
Refine Then Fusion: Training-Free 3D Point Cloud Adaptation with Priority Refinement and Multi-Modal Knowledge Fusion
摘要
最近的预训练基础模型为下游 3D 视觉任务提供了丰富的多模态先验。然而,这些表示在少镜头场景中的有效性受到两个基本挑战的限制:高维特征通常包含大量的通道冗余和与任务无关的噪声,而不同模态的可靠性因样本而异。因此,异质表示的直接聚合忽略了样本相关的模态可靠性,并可能掩盖了重要的判别线索。为了解决这些限制,我们提出了 Refine then Fusion(RTF),这是一种用于少镜头 3D 识别的免训练框架。 RTF 首先通过联合建模类间相似性和类内稳定性来识别判别性特征通道,从而将特定领域的知识细化与预训练模型的缓存表示解耦。然后,它引入了一种可靠性感知融合机制,该机制根据特征细化引起的分布变化来估计样本模态可靠性,从而实现多模态表示的自适应聚合。此外,RTF 构建了一个内存缓存,将实例级支持功能与类级原型集成起来以推断查询标签。对五个基准的大量实验表明,RTF 始终优于单模态基线、部分融合变体和现有的轻量级自适应方法,无需梯度优化、额外训练数据、辅助训练或参数更新即可实现最先进的少镜头 3D 识别性能。