论文

超越硬否定:知识蒸馏 中分数分布对于密集检索的重要性

Beyond Hard Negatives: The Importance of Score Distribution in Knowledge Distillation for Dense Retrieval

摘要

通过 知识蒸馏 (KD) 从跨编码器教师转移知识已成为训练检索模型的标准范例。虽然现有的研究主要集中在挖掘硬否定以改善歧视,但训练数据的系统组成和由此产生的教师分数分布受到的关注相对较少。在这项工作中,我们强调,仅关注硬否定会阻碍学生学习教师的综合偏好结构,从而可能妨碍泛化。为了有效地模拟教师分数分布,我们提出了一种均匀覆盖整个分数范围的分层抽样策略。域内和域外基准的实验证实,分层抽样保留了教师分数的方差和熵,可以作为稳健的基线,在不同的设置中显着优于 top-K 和随机抽样。这些发现表明,蒸馏 的本质在于保留教师感知的相对分数的多样化范围。