论文

检索改进并不能保证更好的答案:用于 AI 政策 QA 的 RAG 研究

Retrieval Improvements Do Not Guarantee Better Answers: A Study of RAG for AI Policy QA

上下文与知识检索增强

摘要

检索增强生成(RAG)系统越来越多地用于分析复杂的政策文件,但在以密集的法律语言和不断发展、重叠的监管框架为特征的领域中,为专家使用提供足够的可靠性仍然具有挑战性。我们使用 AI 治理和监管档案 (AGORA) 语料库(包含 947 个 AI 政策文档的精选集合)研究 RAG 在 AI 治理和政策分析中的应用。我们的系统结合了基于 ColBERT 的 检索器(通过对比学习进行微调)和使用直接偏好优化 (DPO) 来符合人类偏好的生成器。我们构建综合查询并收集成对偏好以使系统适应策略域。通过评估检索质量、答案相关性和 忠实性 的实验,我们发现特定领域的 微调 提高了检索指标,但并不能持续提高端到端问答性能。在某些情况下,当语料库中缺少相关文档时,更强的检索会违反直觉地导致更自信的幻觉。这些结果凸显了那些构建以政策为中心的 RAG 系统的人所关心的一个关键问题:对各个组件的改进并不一定会转化为更可靠的答案。我们的研究结果为在动态监管语料库上设计扎根问答系统提供了实用的见解。