论文

检索增强生成中的幻觉检测和修复

Detecting and Repairing Hallucinations in Retrieval-Augmented Generation

模型推理推理验证与自校正

摘要

语言模型越来越多地通过查阅检索到的文档而不是仅通过记忆来回答问题,这种设计现在在搜索助手和企业知识工具中很常见。在检索到的文本中建立模型会减少不受支持的陈述,但不会消除它们,并且读者无法区分有依据的句子和虚构的句子。大多数关于这个问题的研究都停留在检测阶段,但标记错误的答案对于阅读它的人来说没有任何改变,而且对于应该采取哪些行动也知之甚少。使用 RAGTruth(一个基准,其不受支持的段落是手工注释的),我们将每个标记的答案分成单独的事实主张,根据检索到的来源检查每个事实主张,并将保持答案不变与增加丰富性的三种修复策略进行比较:删除不受支持的主张,用源文本替换它,并重写它。来自不同家族的三种语言模型对 916 修复后的答案进行判断。每个策略都会减少被判断为包含不受支持内容的答案的比例,并且所有三位法官都同意排序。删除实现了最大的减少,同时保留了最少的原始答案,为文本的 64.3%,而重写则保留了 80.1%,减少了最少。修复不仅限于错误的答案:83.5% 注释干净的答案也被编辑。这些策略在基础保护权衡方面占据了不同的点,而不是形成质量排名,并且在它们之间进行选择需要有关自动指标无法提供的答案有用性的证据。