论文

关于多模态表示学习中的模态差距和对比损失

On the modality gap and the contrastive loss in multi-modal representation learning

模型训练预训练

摘要

我们研究了 CLIP 式双编码器对比学习中的模态差距,尽管在共享空间中进行训练,但图像和文本嵌入仍然未对齐。我们认为,这种差距是由带有独立编码器的 InfoNCE 公式的失败引起的。我们使用两个独立的编码器和相同的初始化条件进行了单模态实验,发现 InfoNCE 在低温下主动产生间隙。我们对这种现象进行了理论分析,并表明模态间隙确实是 InfoNCE 的模式故障,但仅限于低温下。我们提出了一种称为 xNCE 的简单修改,它使用联运以及模内负对比对。 xNCE 与 MS-COCO 的检索性能相匹配,同时即使在低温下也能持续缩小差距。值得注意的是,xNCE 在所有基准测试中改进了 InfoNCE 基线上的零样本分类,而高温 InfoNCE 和正则化 InfoNCE 都未能做到这一点,这表明 xNCE 在不牺牲传输所需的判别几何形状的情况下减少了模态差距。