论文
通过制造模态合成将 LMM 推广到多种视觉模态
Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis
摘要
尽管大型多模态模型 (LMM) 在 RGB 视觉方面取得了进步,但它们泛化到未见过的视觉模态的能力仍然是一个很大程度上尚未探索的挑战。我们认为不同的视觉方式仅仅是同一物理世界的不同样本。因此,有效的泛化要求模型既具有与模态无关的场景语义感知,又具有对模态特定特征的适应性。为了实现这一目标,我们提出了一个训练框架,VVM-Tuning,通过模态合成和模态上下文为 LMM 配备这些功能。具体来说,我们从 RGB 场景中合成各种外观变化的图像,训练模型将不变的语义与不同的视觉外观分开,并将这些外观与与模态解耦的视觉概念的语言对齐。然后,我们在提示中引入模态上下文,并使用指令调整来协助模型将这些外观变化映射回模态相关属性,从而在推理过程中实现对未见模态的零样本适应。为了促进这一方向的研究,我们引入了 VVM-Bench,这是一个综合基准,具有 6 种真实和合成模态,用于评估语义感知和模态理解。实验表明,通过我们对合成模态的训练,5 个测试模型在没有模态内训练的情况下对现实世界和新颖的合成模态表现出一致的改进。源代码和数据将在 https://github.com/Hunter-Will/VVM-Tuning 公开提供。