论文
不需要硬否定:以概念为中心的学习可以在不降低对比模型的零样本能力的情况下实现组合性
No Hard Negatives Required: Concept Centric Learning Leads to Compositionality without Degrading Zero-shot Capabilities of Contrastive Models
摘要
对比视觉语言 (V&L) 模型仍然是各种应用的流行选择。然而,也出现了一些局限性,最明显的是 V&L 模型学习组合表示的能力有限。先前的方法通常通过生成自定义训练数据来获取硬负样本来解决此限制。硬负片已被证明可以提高组合性任务的性能,但通常特定于单个基准,不能概括,并且可能导致基本 V&L 功能(例如零样本或检索性能)的大幅下降,从而使其不切实际。在这项工作中,我们遵循不同的方法。我们确定了限制 V&L 组合性能的两个根本原因:1)长训练描述文本不需要组合表示; 2)文本和图像编码器中的最终全局池化首先导致学习绑定所需的信息完全丢失。作为补救措施,我们提出了两个简单的解决方案:1)我们使用标准 NLP 软件获得以概念为中心的简短描述文本部分,并将其与图像对齐; 2)我们引入了无参数跨模态注意池,以从图像编码器获得以概念为中心的视觉嵌入。通过这两个变化和简单的辅助对比损失,我们在标准组合性基准上获得了 SOTA 性能,同时保持或提高了强大的零样本和检索能力。这是在不增加推理成本的情况下实现的。我们在 https://github.com/saic-fi/concept_centric_clip 发布了这项工作的代码。