论文

无需校正的检测:基于激活的幻觉探测中的鲁棒不对称性

Detection Without Correction: A Robust Asymmetry in Activation-Based Hallucination Probing

模型评测模型行为与机制分析

摘要

基于激活的线性探测被广泛提出作为自回归语言模型中检测和纠正幻觉的方法。我们提出了一项跨 7 个模型的实证研究,涵盖 117M 到 7B 参数和三个架构系列(GPT-2、Pythia、Qwen-2.5),记录了强大的不对称性:线性探针可以在较大模型中以高于概率的精度检测幻觉信号,但沿探针导出方向的激活控制无法纠正所测试的 7 个模型中的 7 个模型的幻觉。我们进一步发现,在参数超过 410M 的每个模型中,输出置信度基线在原始检测 AUC 上都优于激活探针,其中 Pythia-6.9B 的差距达到 0.157 AUC。因此,探针的区别值不是检测精度,而是时间定位:探针信号可在位置零处访问(在生成任何输出词元之前),从而实现基于输出的方法在结构上无法提供的预生成标记。时间信号在七个模型中的两个(Pythia-1.4B,p = 0.012;Qwen2.5-7B,p = 0.038)中具有统计显着性,并且在低于 400M 参数的模型和仅碱基的 Pythia-6.9B 中不存在。我们将这些发现定位为占主导地位的探测作为检测和控制研究方向的明确负面结果,并作为基于探测的方法占据互补部署利基(即预生成标记)的初步证据,而不是在原始精度上与基于输出的检测器竞争。