论文

RAG 中幻觉检测的带有分层验证的逆形测试

Retromorphic Testing with Hierarchical Verification for Hallucination Detection in RAG

模型评测评测方法与指标

摘要

大语言模型 仍然可以在检索增强生成(RAG)中产生幻觉,产生不受检索上下文支持或与之冲突的声明。当仅根据检索到的上下文来判断 忠实性 时,检测此类错误仍然具有挑战性:许多现有检测器返回整体答案级别分数,而其他检测器则针对开放域事实或无法提供基于证据的诊断。我们提出了 RT4CHART,一个用于上下文 忠实性 评估的逆向测试框架。 RT4CHART 将答案分解为可独立验证的主张,针对检索到的上下文执行分层的本地到全局验证,并为每个主张分配三个标签之一:必然、矛盾或毫无根据。它进一步将这些声明级决策映射回特定的答案范围,并返回明确的上下文证据,从而实现细粒度的审核而不是不透明的评分。我们在 RAGTruth++(408 个样本)和我们重新注释的 RAGTruth-Enhance(2,675 个样本)上评估 RT4CHART。 RT4CHART 在评估的基线中实现了最佳答案级幻觉检测 F1 分数。在 RAGTruth++ 上,它的精确度为 0.845,召回率为 0.718,F1 分数为 0.776,相对于最强基线提高了 83%。它还在 RAGTruth-Enhance 上获得了 47.5% 的跨度 F1 分数。消融研究表明,基于声明的本地处理推动了大部分观察到的改进,而全局验证则提供了跨数据集的选择性好处。最后,我们的重新注释识别出的幻觉病例比原始标签多 1.68 倍,这表明常用的基准大大低估了幻觉的患病率。