论文

AspectCLIP:通过方面引导的一致性正则化优化 CLIP 表示空间

AspectCLIP: Optimizing CLIP Representation Space via Aspect-Guided Consistency Regularization

模型训练预训练

摘要

对比语言-图像预训练通过大规模对比学习来学习共享表示空间。然而,现有的强制全局一致性正则化的方法忽视了一个关键挑战:图像和文本之间固有的信息不对称:图像描述通常只描述图像的一个特定方面,因此具有相似视觉内容的图像可以与完全不同的文本内容和语义信息配对。因此,全局正则化器无意中在视觉上相似的图像之间施加了约束,而这些图像的图像描述描述了不同的方面,从而在表示空间中引入了语义失真。我们提出了 AspectCLIP,一个重新制定一致性正则化以尊重这种一对多结构的框架。 AspectCLIP 首先根据文本相似性将训练样本划分为属性集群,以识别方面一致的组,然后在每个集群内应用完全循环一致性,同时将跨集群正则化限制为原型级比较。仅当图像和文本描述一致的方面时,这种以方面为导向的正则化才强制执行严格的几何对齐,同时允许跨不同方面的灵活性。对下游任务的大量实验表明,AspectCLIP 始终优于传统方法,并实现了更加结构化的表示空间。