论文
谁从 RAG 中受益?曝光、效用和归因偏差的作用
Who Benefits from RAG? The Role of Exposure, Utility and Attribution Bias
摘要
通过检索增强生成 (RAG) 增强的 大语言模型 (LLM) 通过将其响应基于与用户查询相关的外部文档来实现准确性的显着提高。然而,研究 RAG 对公平性影响的工作相对较少。特别是,与仅 LLM 相比,尚不清楚与公平类别内的某些组相关联的查询是否系统地获得更高的准确性或 RAG 系统中的准确性改进,我们将这种现象称为查询组公平性。在这项工作中,我们进行了大量的实验来研究 RAG 中查询组公平性的三个关键因素的影响,即: 组暴露,即每个组中出现在检索集中的文档的比例,由 检索器 确定;组效用,即每个组的文档有助于提高答案准确性、捕获 检索器 生成器交互的程度;组归因,即生成器在生成响应时依赖每个组的文档的程度。我们使用源自 TREC 2022 Fair Ranking Track 的三个数据集来检查四个公平类别的组级平均准确度和准确度改进差异,以完成两项任务:文章生成和标题生成。我们的研究结果表明,与仅使用 LLM 的设置相比,RAG 系统存在查询组公平性问题,并且放大了来自不同组的查询的平均准确性方面的差异。此外,群体效用、曝光度和归因可以与该群体的查询的平均准确度或准确度提高表现出强烈的正相关或负相关,突出了它们在公平 RAG 中的重要作用。我们的数据和代码可从 Github 公开获取。