论文

检索增强生成中的证据图一致性:幻觉检测的模型相关分析

Evidence Graph Consistency in Retrieval-Augmented Generation: A Model-Dependent Analysis of Hallucination Detection

模型评测评测方法与指标

摘要

检索增强生成(RAG)减少但不能消除 大语言模型 中的幻觉。现有的检测方法依赖于生成的答案和检索到的段落之间的平面相似性,忽略了证据片段和答案主张之间的结构关系。我们提出了证据图一致性(EGC),这是一个框架,它为每个响应构建一个局部证据图,并计算五个结构一致性度量作为幻觉指标。对 RAGTruth 在六个 LLM(5,767 个响应)中的完整问答分裂进行评估,EGC 揭示了一致的模型系列分裂:图形一致性特征显示了 Llama-2 模型中幻觉的预期诊断方向,但在 GPT-4、GPT-3.5 和 Mistral-7B 中表现出系统性逆转。这种逆转表明模型家族之间的幻觉模式有质的不同,并表明基于嵌入的图一致性不能充当独立于模型的幻觉检测信号。