论文

数据,而不是模型:解释神经 检索器 中对 LLM 文本的偏见

Data, Not Model: Explaining Bias toward LLM Texts in Neural Retrievers

模型评测鲁棒性、公平性与可信度评测

摘要

最近的研究表明,神经 检索器 经常表现出源偏见,偏爱由 LLM 生成的段落而不是人类编写的段落,即使两者在语义上相似。这种偏见被认为是 检索器 的固有缺陷,引发了人们对现代信息访问系统的公平性和可靠性的担忧。我们的工作挑战了这一观点,表明源偏差源于检索数据集的监督,而不是模型本身。我们发现正面和负面文档之间存在非语义差异,例如流畅性和术语特异性,反映了 LLM 和人类文本之间的差异。在嵌入空间中,从负数到正数的偏差方向与从人类编写的文本到 LLM 生成的文本的方向一致。我们从理论上证明,检索器 在对比学习过程中不可避免地吸收训练数据中的伪影不平衡,这导致他们对 LLM 文本的偏好。为了减轻这种影响,我们提出了两种方法:1)减少训练数据中的伪影差异,2)通过删除 LLM 文本向量在偏差向量上的投影来调整它们。两种方法都大大减少了源偏差。我们希望我们的研究能够减轻有关信息访问系统中 LLM 生成文本的一些担忧。