论文

幻觉可从量化 LLM 中的中层隐藏状态线性解码

Hallucination Is Linearly Decodable from Mid-Layer Hidden States in Quantized LLMs

模型评测模型行为与机制分析

摘要

我们研究开源 LLM 是否在其隐藏状态编码线性可分离的真实性信号,以及该信号在哪个网络深度最强。在加载了 $4$ 位 NF4 量化的三个 $7$B--$8$B 指令调整模型(Llama-3.1-8B、Mistral-7B、Qwen2.5-7B)中,我们在四个幻觉基准(TruthfulQA、HaluEval-QA、FEVER 和受控合成集)上提取每层隐藏状态,并比较四种检测方法:线性和 MLP 探针、INSIDE EigenScore、自我一致性和注意力熵。单个中间网络层上的线性探针在保持分割上实现 $0.904$--$1.000$ AUROC,而基于采样的检测器在相同协议下不会超过 $0.541$ AUROC。真实性信号近似线性:MLP 探针很少超过线性探针超过 $0.01$ AUROC。在自然语言基准上,各个模型系列的峰值探测层落在一致的范围内——Llama 和 Mistral 的块~$13$--$18$ 到~$32$,Qwen 的块~$19$--$25$ 到~$28$。第一块注意力熵在基于知识的环境中提供补充信号(HaluEval-QA 上的 AUROC 为 0.866 - 0.941 ),无需额外的推理成本。本协议下采样方法的低辨别性反映了配对标签评估与这些方法访问的信息之间的结构不匹配,而不是这些方法的固有限制。代码和数据已发布,可在单个 $8$\,GB GPU 上完全重现。