论文

对抗大型多模态模型中的视觉忽视和语义漂移,以增强跨模态检索

Combating Visual Neglect and Semantic Drift in Large Multimodal Models for Enhanced Cross-Modal Retrieval

模型训练监督微调与指令调优

摘要

尽管由大型多模态模型(LMM)支持的统一多模态检索(UMR)取得了重大进展,但现有的嵌入方法主要通过对比学习关注样本级目标,而忽略了关键的主题级语义。这种限制阻碍了模型在复杂的多模态查询中对语义连贯的主题进行分组的能力,表现为语义对齐偏差——模型无法准确定位视觉内容中的显着文本引用区域。此外,如果没有明确的指导来对显着视觉主题进行建模,LMM 往往会过度依赖文本提示,从而导致视觉模态忽视和视觉知识的次优利用。为此,我们提出了显着性主题感知多模态嵌入(SSA-ME),这是一种新颖的框架,旨在通过显着性感知建模来增强细粒度表示学习。 SSA-ME 利用 LMM 和视觉专家来识别和强调图像-文本对中的显着视觉概念,并引入显着性引导目标,以更好地将跨模态注意力与语义有意义的区域结合起来。此外,特征再生模块根据导出的显着性图重新校准视觉特征,确保跨模态的平衡和语义一致的集成。大量实验表明,我们的方法在 MMEB 基准上实现了最先进的性能,证明合并主题级建模可以显着改善多模态检索。全面的定性分析进一步说明了我们方法的可解释性和有效性。