论文

幻觉信号是均值漂移:为什么简单的探针就足够了

The Hallucination Signal Is a Mean Shift: Why Simple Probes Suffice

模型评测模型行为与机制分析

摘要

隐藏状态探针可以有效检测 LLM 幻觉,但信号的几何形状仍然很难表征,导致探针架构变得越来越复杂。在配对示例范式中的三个 7B 规模模型和三个数据集中,我们发现信号绝大多数由单个均值漂移分量主导,并且删除该方向会使检测崩溃。收缩线性判别分析缩小了一维分类器和全维分类器之间约 73% 的差距,因此明显的架构复杂性在很大程度上反映了高维协方差估计的难度,而不是可利用的非线性。一个简单的 L2 正则化逻辑回归(0.952 AUROC)限制或优于 12 种受控架构替代方案,并且我们的多层聚合超过了匹配范式下的 CLAP 跨层注意探测。由于信号跨越连续的层频带,LayerMix 将其聚合以匹配预言机层性能,而无需预言机访问。我们的主张描述了受控配对示例范例中的几何形状。我们的代码可在 https://github.com/js-lee-AI/LayerMix 获取。