论文
按推理要点追踪RAG证据不确定性与幻觉
Facet-Level Tracing of Evidence Uncertainty and Hallucination in RAG
摘要
检索增强生成(RAG)通过让回答基于检索证据减少幻觉,但即使存在相关文档,仍可能产生幻觉答案。现有评价侧重答案或段落准确率,难以解释证据在生成过程中如何被使用。本文提出推理要点级问答诊断框架,将问题拆解为原子推理要点。针对各要点,以结构化的要点—文本片段矩阵结合检索相关性和基于自然语言推断的忠实性评分,检查证据充分性及回答是否依托证据。研究比较三种受控推理模式:完全依赖检索证据的严格RAG、结合证据与模型参数知识的Soft RAG,以及不检索的纯大模型生成。比较能够诊断检索与生成的不一致,即相关证据已被检索、却未被正确用于生成。在医学问答与HotpotQA上,研究评价GPT、Gemini和LLaMA等三种开放或闭源模型,揭示证据缺失、证据使用错位及先验知识覆盖证据等常见失效。结果表明,在所测设置中,幻觉更受证据如何整合进生成过程影响,而非单纯由检索准确率决定。要点级分析可揭示答案级评价隐藏的系统性证据覆盖和使用错位。