论文
幻觉检测基准的标签问题
The Labeling Problem in Hallucination Detection Benchmarks: An Empirical Evaluation
摘要
近年来,已经开发了几种检测大语言模型(LLM)何时产生幻觉的方法。这些方法通常以包含问题和相应简短参考答案的开放域问答 (QA) 数据集为基准。首先,LLM 用于生成 QA 数据集中问题的答案。然后,通过将这些答案与数据集中的参考答案进行比较,使用一些自动标记策略将这些答案标记为幻觉或非幻觉。这种评估设置在两个标准之间造成了方法上的模糊性:参考忠实度(答案是否完全得到参考的支持)和事实正确性(答案是否不存在矛盾和事实上错误的具体主张)。在实践中,即使预期目标是后者,自动标注器也可以应用前一个标准。我们使用涵盖三个常用 QA 数据集和三个生成器模型的 900 个人工标记的问答对来研究这种潜在的标准不匹配,并带有针对答案级别事实正确性的标签。我们评估词汇相似性指标、参考蕴涵 NLI 基线以及作为自动标记器的受控提示变体下的 7 个 LLM 判断器。我们的实验揭示了自动标记策略之间以及这些标签与人工标注之间存在很大的分歧。许多策略还表现出强烈的方向性错误偏差,并且对于大多数判断-生成器对来说,用事实正确性提示替换以忠实为导向的提示可以提高与人类注释的一致性并减少假阳性优势,这表明自动幻觉标签在很大程度上取决于目标标准的指定方式。因此,标签源选择应被视为基准设计的基本部分,并使其明确、经过验证并与基准目标相匹配。
