论文
Omni-NegCLIP:通过前层对比 微调 增强 CLIP,以实现全面的否定理解
Omni-NegCLIP: Enhancing CLIP with Front-Layer Contrastive Fine-Tuning for Comprehensive Negation Understanding
摘要
视觉语言模型 (VLM) 在广泛的多模式任务中表现出了强大的能力。然而,最近的研究表明,诸如 CLIP 之类的 VLM 在理解自然语言中常见的否定表达方面表现不佳。在这项工作中,我们提出了 Omni-NegCLIP,一种微调的 CLIP 模型,通过修改 CLIP 的原始 InfoNCE 对比损失,提高了 CLIP 对两种类型否定的理解,即基于存在的否定和基于缺席的否定,这两种否定分别对应于图像中实际存在的对象和图像中可能存在但实际上不存在的对象的否定表达式。具体来说,我们设计了一个基于存在的对比目标,使图像嵌入更接近其原始图像描述嵌入,同时将它们推离相应的基于存在的否定图像描述嵌入,以及一个基于缺席的对比目标,将图像嵌入与原始和基于缺席的否定图像描述嵌入对齐,同时保持两个文本嵌入之间的语义区别。根据我们的观察,CLIP 文本编码器的前 Transformer 层比后面的层具有更强的否定文本学习能力,我们使用组合对比目标在每个训练步骤中微调 CLIP 文本编码器的前 Transformer 层。实验结果表明,与预训练的 CLIP 相比,Omni-NegCLIP 在基于存在的否定和基于缺失的否定任务上的性能分别提高了 52.65% 和 12.50%,并且不牺牲图像文本检索的一般能力,甚至提高了 19.62%。与之前的作品相比,Omni-NegCLIP 表现出了更全面的理解多种类型否定任务的能力。