论文

多跳检索增强生成的共形事实性控制

Conformal Factuality Control for Multi-Hop Retrieval-Augmented Generation

模型评测鲁棒性、公平性与可信度评测

摘要

检索增强生成(RAG)可以在外部证据中建立大语言模型,但检索到的上下文并不能保证生成的主张得到事实支持。这个问题在多跳 RAG 中尤其重要,其中检索和推理通过多个相关阶段进行。我们研究了先前为 RAG 开发的声明级共形事实性控制在这种情况下是否仍然有效。我们将分割共形声明过滤应用于多跳 RAG,并使用 Llama 3.1 8B 和 GPT-4o-mini 以及单跳参考实验在 HotpotQA、Natural Questions 和 TriviaQA 上对其进行评估。在所有六个多跳模型数据集配置中,日益严格的保形目标不断增加保留声明得到完全支持的响应的比例。在 95% 的目标下,该比率范围为 95.80% 至 97.20%,而未经过滤的比率为 55.60%-76.03%。然而,这种改进具有很强的选择性:只有 4.41%-31.09% 的生成声明被保留,9.70%-51.40% 的响应在 95% 的目标下保持非空。这些结果表明,共形事实性扩展到多跳 RAG,同时证明名义可靠性必须与声明保留和弃权结合起来解释。