论文

通过正则化 微调 进行 3D 视觉语言模型的领域可推广适应

Domain Generalizable Adaptation of 3D Vision-Language Models via Regularized Fine-Tuning

模型训练监督微调与指令调优

摘要

领域适应仍然是 3D 视觉中的一个核心挑战,特别是对于将 3D 点云与视觉和文本数据对齐的多模态基础模型。虽然这些模型表现出强大的通用能力,但将它们适应数据有限的下游领域通常会导致过度拟合和灾难性遗忘。为了解决这个问题,我们引入了 ReFine3D,这是一个正则化的 微调 框架,专为 3D 大型多模态模型 (LMM) 的领域通用调整而设计。 ReFine3D 将选择性层调整与两种有针对性的正则化策略相结合:增强点云的多视图一致性和通过 大语言模型 生成的基于同义词的提示实现文本多样性。此外,我们还将点渲染视觉监督和测试时间增强机制与基于置信度的聚合相结合,以进一步增强鲁棒性。跨不同 3D 域泛化基准的大量实验表明,ReFine3D 将基础到新颖的类泛化提高了 1.36%,跨数据集传输提高了 2.43%,对损坏的鲁棒性提高了 1.80%,少数样本准确率提高了 3.11%,以最小的增加计算开销超越了先前最先进的方法。