论文
标题到底说了什么?视觉语言预训练中成分数据选择的反事实短语干预
What Does the Caption Really Say? Counterfactual Phrase Intervention for Compositional Data Selection in Vision-Language Pretraining
摘要
CLIP 式对比预训练通常使用样本级过滤信号来管理网络规模的图像文本对,通常基于对级对齐。我们表明该信号饱和:一旦消除了粗略的不匹配,更严格的全局过滤就不再跟踪保留的字幕提供的组成监督。原因是结构性的——全局分数将一对是否广泛合理与标题中的单个对象、属性和关系短语是否实质上支持图像文本匹配混为一谈。后者是组合泛化所要求的,但对级过滤器对此视而不见。我们通过反事实短语干预(CPI)来解决这个问题,这是一个短语级管理框架,可将受控的随机数标记替换转换为图像条件的短语敏感度分数。 CPI 仅使用全局对齐来粗略地消除不匹配,然后根据标题短语是否在受控替换下显着影响图像文本分数来对幸存池进行排名。我们将 CPI 视为一阶短语敏感性信号,而不是视觉定位或识别结果,并在 CC3M 尺度上对其进行评估。按此信号进行排名会产生 50% 数据子集,与完整数据基线相比,VL-CheckList-VG 关系提高了 +1.91,在匹配的预算下,与仅对齐过滤相比提高了 +1.00,同时提高了 SugarCrepe 的整体性能并保留了一般传输。 CPI 是损失正交的:不变地应用于 NegCLIP,它进一步将 VL-CheckList-VG Relation 提高了 +3.84,并在正文中增加了 CE-CLIP 增益。