论文

相关性证据不足:在 RAG 生成之前检测证据差距

Relevance Is Not Sufficient Evidence: Detecting Evidence Gaps Before Generation in RAG

上下文与知识检索增强

摘要

检索增强生成 (RAG) 将大语言模型建立在外部来源中,但检索到的段落通常会命名正确的实体,但不会提供回答所需的事实。即使被指示弃权,12 个生成器也回答了 40.0-99.3% 的证据不足问题。训练生成器放弃将决策与模型权重联系起来,可能会奖励从参数知识中回忆起的答案,并且仍然需要完整的生成器调用。在没有答案出现之前,能否仅根据问题和证据来判断充分性?我们发现了构建证据不足测试的陷阱:删除相关证据或将证据与不相关的问题配对可以通过词汇重叠或证据位置揭示标签。我们使用替换、删除和问题交换结构构建配对基准,这些结构改变答案支持,同时控制选定的表面特征,例如单词使用。可以在不生成答案的情况下判断充分性,但没有一个信号适用于所有数据集。我们引入了 RINSE(相关性不充分证据),它结合了三个信号:是否涵盖了问题的每个部分,是否有任何段落提供了答案,以及一起阅读段落的小型语言模型是否判断它们是充分的。在六个数据集中,RINSE 的得分为 0.837(机会 0.5),超过了证据不足,超过了 10 种现有方法中最好的方法 (0.746) 和通过 API 查询的前沿模型 (0.784)。其最弱的数据集得分高于任何其他方法最弱的数据集(0.684 与 0.676)。 RINSE 在生成之前在本地运行,在单个 GPU 上每个问题需要 36.5 毫秒。