论文

SNAP:视觉语言预训练中的合成难负例为何有效?

What Makes Synthetic Hard Negatives Work in Vision-Language Pretraining?

模型训练模型评测预训练合成数据模型行为与机制分析

摘要

事实证明,表示空间中生成的综合硬负例对于单模态自监督学习是有效的,但将这种想法转移到视觉语言预训练并不简单。我们分析了六种表示空间合成策略,并确定了它们在转移到视觉语言预训练过程中的两种失败模式:产生过于简单的否定或将其拉向查询的跨模态结构,以及包含匹配的正值的模内结构。当使用合成硬负片和可学习温度进行训练时,我们还观察到了对数尺度饱和度,并发现固定温度可以提高下游性能。使用这种几何分析,我们提出了 SNAP,它生成模态内的硬负数,从不涉及任何模态的正数,从而完全避免了两种失效模式。 SNAP 与模型无关,不需要外部生成模型,并且增加的训练时间开销不到 10%。在跨多个架构和数据集的 CLIP 和 FLIP 之上进行评估,SNAP 在以下方面提供了一致的改进: 零样本检索、零样本分类和线性探针评估。

SNAP:视觉语言预训练中的合成难负例为何有效?:论文原图
表 1:跨模式与内部模式策略。在跨模式模式下应用所有六种策略会将性能降低到 CLIP 基线以下。转换为模式内模式有所帮助,但仍然表现不佳。限制为 s=3s=3 和 s=4s=4 可恢复性能。我们突出显示默认的超参数。