论文

PARALLAX:将真正的幻觉检测与基准构建工件分开

PARALLAX: Separating Genuine Hallucination Detection from Benchmark Construction Artifacts

模型评测评测方法与指标

摘要

大语言模型 (LLM) 充满信心地产生幻觉:他们的输出可以是流畅的、权威的,但也可能是错误的。在医学、法律和科学应用中,这种故障会造成直接伤害,从内部模型状态检测它提供了一条更安全部署的途径。越来越多的工作报告称,这个问题越来越容易处理,最近的方法在广泛使用的基准上实现了高检测性能。然而,我们表明,这些明显的进步大部分都经不起审查。六个语料库中的四个将 真值 答案直接嵌入到输入提示中。我们称之为 \textsc{TxTemb} 的朴素文本相似性基线利用这一点来实现近乎完美的检测分数,而无需访问模型内​​部。为了衡量一旦这些伪影得到控制,真正的检测能力仍然存在,我们进行了大规模评估,涵盖 22 种检测方法、跨越 6 个架构系列的 12 个开源模型和 6 个语料库。我们进一步引入 \textbf{DRIFT},一种针对层间隐藏状态转换的监督探针,作为实时生成检测的比较点。我们的研究结果表明,该领域报告的幻觉检测进展基本上可以通过广泛使用的语料库中的基准构建工件来解释,并且大多数已建立的基线在受控条件下几乎是偶然执行的;一致的例外是 SAPLMA 和 DRIFT,它们都是针对上层隐藏状态的监督探测。