论文

幻觉神经元及在哪里找到它们:关于幻觉神经元存在性的研究

Hallucination Neurons and Where to Find Them: An Investigation into the existence of Hallucination Neurons

模型评测模型行为与机制分析

摘要

大型语言模型(LLM)的可解释机器学习日益依赖稀疏探针方法,这些方法识别出据称能检测并因果影响事实回忆、安全对齐和幻觉等行为的小规模神经元集合。这些主张对模型审计和行为引导具有重要影响,却很少在相关的高维特征空间中针对L1正则化探针的已知失效模式进行检验。我们提出一个五步诊断协议,涵盖特征相关、bootstrap稳定性、稀疏与稠密排序分歧、干预基线和跨数据集评估,作为稀疏神经元定位主张的最低标准。我们用所提方法考察先前工作,特别是开源LLM在TriviaQA、BioASQ和NQ-Open数据集上的H-神经元。结果表明检测在模型和数据集上均可复现,并在TriviaQA和BioASQ上超过原报告的AUROC差距。在匹配数据集上Gemma 3 4B持续优于MedGemma 4B:TriviaQA上AUROC差距为+0.311对+0.235,BioASQ上为+0.474对+0.455,NQ-Open上为+0.128对+0.112。n=500、五个随机种子的因果验证显示出超越随机同层基线的统计显著效应。与此同时,诊断结果表明所选神经元并非唯一局域化。在Gemma 3 4B的三个设置中,22个被选H-神经元中有19个与其他特征的Pearson |r| > 0.7,bootstrap选择仅显示中等稳定性,稀疏与稠密排序的重叠很弱。我们的发现表明,稀疏预测结构可以与非唯一的神经元选择共存。在机制可解释性中,例行诊断验证对于区分检测主张与定位主张是必要的。