论文
DebiasRAG:通过检索增强生成在 大语言模型 中实现公平生成的免调整路径
DebiasRAG: A Tuning-Free Path to Fair Generation in Large Language Models through Retrieval-Augmented Generation
摘要
大语言模型 (LLM) 因其卓越的生成能力而取得了前所未有的成功。然而,由于它们依赖于训练语料库中封装的知识,因此可能会产生幻觉、刻板印象和社会偏见的内容。特别是,LLM容易产生涉及种族、性别和年龄的偏见反应,统称为社会偏见。先前的研究已经使用 微调 和提示工程来减轻 LLM 中的此类偏差,但这些方法需要额外的训练资源或领域知识来设计框架。此外,它们可能会降低 LLM 的原始功能,并且常常忽视动态去偏上下文以实现更公平的推理的需要。在本文中,我们提出了 DebiasRAG,一种基于检索增强生成(RAG)的新颖的免调优和动态查询特定去偏框架。 DebiasRAG 提高了公平性,同时保留了 LLM 的内在属性,例如表示能力。 DebiasRAG 由三个阶段组成:(1)特定于查询的去偏候选生成; (2)上下文候选库构建; (3)梯度更新去偏引导上下文片段重新排序。首先,DebiasRAG 通过定期检索利用与查询相关的自我诊断偏差上下文,其中偏差上下文由 DebiasRAG 提供者离线准备。给定特定于查询的偏差上下文,DebiasRAG 反向生成去偏差上下文,这些上下文作为 LLM 输出的附加公平性约束提供。其次,常规 RAG 检索过程从常规 RAG 文档数据库(例如分块维基百科数据集)生成与查询相关的上下文。