论文

虚假引用的来源:在 LLM 中追踪特定神经元的场级幻觉

Where Fake Citations Are Made: Tracing Field-Level Hallucination to Specific Neurons in LLMs

模型评测模型行为与机制分析

摘要

LLM 经常生成虚构但令人信服的引文,即使潜在的参考文献是错误的,也常常表现出高度的置信度。我们研究了 9 个模型和 108{,}000 个生成的参考文献中的这种失败,发现作者姓名在所有模型和设置中比其他字段失败的频率要高得多。引文风格没有可测量的效果,而以推理为导向的 蒸馏 会降低召回率。在一个领域训练的探针以近乎偶然的水平转移到其他领域,这表明幻觉信号不会跨领域普遍化。基于这一发现,我们将具有稳定性选择的弹性网络正则化应用于 Qwen2.5-32B-Instruct 的神经元级 CETT 值,并识别一组稀疏的特定场幻觉神经元(FH 神经元)。因果干预进一步证实了它们的作用:放大这些神经元会增加幻觉,而抑制它们会提高跨领域的表现,在某些领域有更大的收获。这些结果提出了一种仅使用内部模型信号来检测和减轻引文幻觉的轻量级方法。