论文

修复:将检索失败转变为反事实硬对

RePair: Turning Retrieval Failures into Counterfactual Hard Pairs

模型训练合成数据

摘要

使用 CLIP 式双编码器的视觉语言检索可实现强大的跨模态性能,但实际准确性通常取决于局部语义区别,其中排名靠前的未遂匹配与真实匹配仅存在一个关键细节的差异。硬样本挖掘可以选择容易混淆的候选者,但无法构建正确的对应者;合成增强可以生成新颖的样本,但在不以实际模型故障为条件的情况下,目标是不相关的硬度维度。我们观察到排名靠前的误报是一个反事实支架——共享大部分查询语义,但在导致局部失败的残差方面有所不同。最小程度地纠正该残差会以相同的方式产生 真值 的硬阳性;纠正后的版本和未经编辑的版本形成了跨越决策边界的硬负对,产生互补的拉推监督。我们引入了 RePair,它以三个原则为指导:有效性、最小性和局部性,它双向挖掘误报,应用 LLM 引导的反事实编辑,并使用局部硬对对比目标进行训练。在 Flickr30K 和 COCO30K 上,RePair 的性能优于受控增强基线,仅使用 107K 合成样本——比同类方法少 26%--75%——确认故障条件修复比错误无关增强更具有数据效率。