论文
SNAP:视觉语言预训练中的合成难负例为何有效?
What Makes Synthetic Hard Negatives Work in Vision-Language Pretraining?
摘要
事实证明,表示空间中生成的综合硬负例对于单模态自监督学习是有效的,但将这种想法转移到视觉语言预训练并不简单。我们分析了六种表示空间合成策略,并确定了它们在转移到视觉语言预训练过程中的两种失败模式:产生过于简单的否定或将其拉向查询的跨模态结构,以及包含匹配的正值的模内结构。当使用合成硬负片和可学习温度进行训练时,我们还观察到了对数尺度饱和度,并发现固定温度可以提高下游性能。使用这种几何分析,我们提出了 SNAP,它生成模态内的硬负数,从不涉及任何模态的正数,从而完全避免了两种失效模式。 SNAP 与模型无关,不需要外部生成模型,并且增加的训练时间开销不到 10%。在跨多个架构和数据集的 CLIP 和 FLIP 之上进行评估,SNAP 在以下方面提供了一致的改进: 零样本检索、零样本分类和线性探针评估。
