论文

用于增强视觉语言组合性的跨模态掩码组合概念建模

Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality

模型训练预训练

摘要

像 CLIP 这样经过对比训练的视觉语言模型在学习图像-文本联合表示方面取得了显着进展,但在组合理解方面仍然面临挑战。它们经常表现出“词袋”行为——努力捕获对象关系、属性-对象绑定和词序依赖性。这种限制不仅源于对全局、单向量表示进行优化的依赖,还源于对成对图像文本数据中固有的丰富组成信息的充分利用和建模。在这项工作中,我们提出了 MACCO(MAsked Compositional Concept MOdeling),这是一个框架,它掩盖一种模态中的构图概念,并根据来自另一种模态的完整上下文信息重建它们,使模型能够更有效地捕获和对齐跨模态构图结构。为了促进这一过程,我们引入了两个辅助目标,它们在模态间和模内联合对齐和正则化屏蔽特征。对五个组合基准的广泛实验以及深入分析表明,我们的方法不仅显着增强了 VLM 的组合性,而且还提高了它们捕获句法结构和语言信息的能力。此外,改进的组合性也有利于文本到图像的生成和多模态 大语言模型。代码可在 https://github.com/hiker-lw/MACCO 获取。