论文

SMA:用于数据高效多模态学习的子模态对准器

SMA: Submodular Modality Aligner For Data Efficient Multimodal Learning

模型训练预训练

摘要

尽管多模态基础模型(FM)最近取得了成功,但它们对大量配对数据集的依赖限制了它们在低数据和罕见场景设置中的适用性,在这些场景中,对齐数据稀缺且昂贵。一个关键的瓶颈是采用实例级公式,它通过最大化各个图像-文本对之间的相关性来学习对齐,同时忽略跨模态的底层几何结构,从而导致输入模态之间的模态间隙。在本文中,我们提出了一种多模态对齐的组合范式,超越了成对学习,并引入了\emph{子模态对齐器(SMA)},它将实体的多个增强和描述视为一个集合,利用数据的多个描述来捕获更丰富的跨模态结构。我们使用基于子模互信息(SMI)的原则目标来实例化 SMA,它共同最大化了模态间互信息,同时减少了跨模态发散。这种公式使模型能够有效地利用多个正关联,并从有限的数据中提取更多的信息。我们在 CLIP 基准测试中的 14 个零样本分类和检索任务上评估 SMA,并展示了在低数据情况下的一致增益。值得注意的是,SMA 仅使用数万个样本就实现了强大的多模态泛化。这比标准方法少几个数量级。我们的结果强调了基于集合的公式和子模块目标对于数据高效的多模态学习的重要性。