论文
当硬负片受到伤害时:弥合硬负片合成检索中的生成判别差距
When Hard Negatives Hurt: Bridging the Generative-Discriminative Gap in Hard Negative Synthesis for Retrieval
摘要
硬负例挖掘已成为训练 检索器 的主导策略,但它面临着内在的局限性:负例受到语料库可用性的限制,通过 检索器 分数而不是诊断价值进行选择,并且随着 检索器 的改进,负例越来越受到误报的污染。基于 LLM 的合成提供了一种有原则的替代方案,其中阴性结果不受约束、有针对性且没有误报风险。但我们表明,天真地将生成的否定纳入对比学习中通常会降低检索性能。我们将根本原因确定并形式化为生成判别差距:LLM 生成针对流畅、可信的文本进行优化,而对比学习则要求在决策边界上战略性地违反相关性。我们的分析揭示了两种复合故障模式:区分性不可知生成,其中 LLM 缺乏查询信息需求的明确模型,并且默认为不提供对比信号的通用或主题漂移文本;以及依赖于源的捷径,其中分布伪影使模型能够根据来源而不是相关性来区分负数,从而导致梯度漂移,从而主动破坏优化。为了弥补这一差距,我们提出由两个主要模块组成的 CausalNeg:(1)用于数据构建的 CoT 引导的反事实扰动:将文档满足查询的原因分解为明确的信息要求,然后通过外科手术违反个人要求,以受控的、可解释的硬度构建负数。 (2) 训练期间的查询视图熵最大化:将生成的负数分散到相似度谱中,最小化源身份和相似度分数之间的互信息以抑制捷径利用。我们在 https://github.com/mzhangzhi Cheng/CausalNeg 上公开提供我们的代码。