论文
迈向 FairRAG:通过在检索时强制公平曝光来防止检索增强生成中的代表性损害
Towards FairRAG: Preventing Representational Harm in Retrieval-Augmented Generation by Enforcing Fair Exposure at Retrieval Time
摘要
随着 大语言模型 (LLM) 集成在高风险领域的加速,模型幻觉是一个关键问题。检索增强生成(RAG)是一种解决幻觉的技术;然而,RAG 的多组件管道引入了可能引入偏差的漏洞。本研究考虑了两种先前开发的以效用为中心的排名策略(标准和随机)以及两种拟议的暴露感知方法(强制暴露和代表性随机)。使用 TREC 2022 公平排名数据集(其中包含注释为受保护或不受保护的维基百科文章),LLM 被要求识别带有四个基于场景的问答提示的引用的相关文章。评估了检索排名和生成的输出的曝光偏差和所有排名方法的实用性。总体而言,代表性随机排序器产生了统计上显着的接近均等的平均曝光度,承认检索过程中最初产生的相关性分数已经受到代表性偏差的影响,而其他排序器则假设这些分数是无偏差的。在所有文档排名方法中,世代人口统计均等密切反映了曝光均等,这强化了 RAG 系统中的代表性偏差是由检索驱动的并传播到世代。这些发现强调,检索排序是减轻下游偏差的关键点,并提出了一种代表性随机排序器,可以在 RAG 系统中重新引入公平性。