论文
多模态代码切换:将视觉对象交织到语言中以实现显式对象级对齐
MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment
摘要
现有的多模态 大语言模型 (MLLM) 主要依靠图像-文本对进行模态对齐预训练,将全局图像表示映射到长文本描述。然而,这种图像级对齐存在引用模糊性:模型很难从全局表示中推断出多个视觉对象和文本实体之间的对应关系,导致数据效率低下和语义基础欠佳。为了解决这个问题,我们提出了多模态代码切换(MMCS),这是一种提供显式对象级监督的新型预训练范例。受语码转换语言现象的启发,MMCS 通过用相应的视觉对象替换文本实体,将视觉和语言交错在一起,强化本地视觉语言基础。我们进一步开发了一个可扩展的数据合成管道,以生成具有准确的对象实体对应关系的 773K 样本的预训练数据集。实验表明,MMCS 具有很高的数据效率:只需 50K 个样本,它就可以匹配或超过在 600K 个图像文本对上训练的模型。此外,MMCS 持续改进不同模型尺度的视觉基础和感知能力。