论文
重新思考LLM幻觉检测的评估:一套应有属性、一个新的RAG基准与新见解
Rethinking Evaluation for LLM Hallucination Detection: A Desiderata, A New RAG-based Benchmark, New Insights
摘要
幻觉,泛指LLM生成的不忠实、虚构或不一致的内容,具有广泛的影响。因此,大量工作投入到检测LLM幻觉以及设计用于评估这些检测器的基准数据集上。在本工作中,我们首先建立了一套幻觉检测基准(HDB)为实现有效评估而应具备的应有属性。以这套应有属性审视现有HDB可以发现,没有任何一个具备全部属性。我们识别出两个最大的缺口:(1)具有长上下文的基于RAG的接地基准严重缺乏(部分原因是长文本阻碍人工标注);(2)现有基准没有提供真实的标签噪声用于对检测器进行压力测试,而现实使用场景常因人工或自动化/弱标注而受到标签噪声困扰。为弥合这些缺口,我们构建并开源了一个新的基于RAG的HDB,名为TRIVIA+,它经历了严格的人工标注流程。值得注意的是,我们的基准具备全部所需属性,包括:(1)TRIVIA+包含文献中最长上下文的样本;(2)我们设计并共享四套带噪标签,涵盖样本依赖与样本无关的不同噪声方案。最后,我们使用流行的SOTA检测器在基于RAG的HDB(包括我们的TRIVIA+)上进行实验,得到新的见解:(i)当前检测器在基于RAG的HDB上距离性能天花板仍有很大空间;(ii)基本的LLM-as-a-Judge基线表现具有竞争力;(iii)标签噪声会妨碍检测性能。我们期望这些发现连同我们提出的基准,能激励并促进针对基于RAG任务的幻觉检测这一亟需的研究。
