论文

幻觉神经元会泛化吗? LLM 中跨域传输的证据

Do Hallucination Neurons Generalize? Evidence from Cross-Domain Transfer in LLMs

模型评测模型行为与机制分析

摘要

最近的工作确定了一组稀疏的“幻觉神经元”(H 神经元),不到前馈网络神经元的 0.1%,可以可靠地预测 大语言模型 何时会产生幻觉。这些神经元在常识问答中被识别,并被证明可以推广到新的评估实例。我们自然会提出一个后续问题:H 神经元是否可以跨知识领域进行泛化?使用跨 6 个领域(一般 QA、法律、金融、科学、道德推理和代码漏洞)和 5 个开放权重模型(3B 到 8B 参数)的系统性跨域传输协议,我们发现它们没有。在一个域的 H 神经元上训练的分类器在域内达到 AUROC 0.783,但当转移到不同的域时仅为 0.563(delta = 0.220,p < 0.001),所有测试模型的降级都是一致的。我们的结果表明,幻觉不是具有通用神经特征的单一机制,而是涉及特定领域的神经元群体,这些神经元群体根据所查询的知识类型而有所不同。这一发现对神经元级幻觉探测器的部署具有直接影响,神经元级幻觉探测器必须针对每个域进行校准,而不是一次训练并普遍应用。