论文

MiMIC:减轻通用多模态检索中的视觉模态崩溃,同时避免语义错位

MiMIC: Mitigating Visual Modality Collapse in Universal Multimodal Retrieval While Avoiding Semantic Misalignment

摘要

通用多模态检索(UMR)旨在将不同模态(例如视觉和文本)映射到共享嵌入空间以进行多模态检索。现有的UMR方法大致可分为两类:早期融合方法,例如Marvel,它将视觉特征投影到语言模型(LM)空间中以与文本模态集成;后期融合方法,例如UniVL-DR,它使用单独的编码器对视觉和文本输入进行编码,并通过加法获得融合嵌入。我们的试点研究表明,漫威表现出视觉模态崩溃,其特点是模型倾向于忽视视觉特征而过度依赖文本线索。相比之下,虽然 UniVL-DR 受此问题的影响较小,但它更容易受到语义错位的影响,即语义相关的内容在嵌入空间中的位置相距很远。为了应对这些挑战,我们提出了 MiMIC,它引入了两项关键创新:(1)用于有效多模态集成的解码器融合架构,以及(2)通过单模态 mixin 和随机图像描述 dropout 进行稳健训练。在 WebQA+ 和 EVQA+ 数据集上进行的实验(其中文档或查询中的图像可能缺少图像描述)表明 MiMIC 始终优于早期和晚期融合基线。