论文

分析《大语言模型》中幻觉与知识冲突的相关性

Analyzing the Correlation Between Hallucinations and Knowledge Conflicts in Large Language Models

模型评测模型行为与机制分析

摘要

幻觉——事实上不正确或无法验证的输出——仍然是 大语言模型 (LLM) 最具挑战性的限制之一,特别是在知识密集型任务中。一种提出的解释是固定的、过时的训练数据引起的内部知识冲突。本文研究了与知识冲突相关的内部表征是否与 LLM 中的幻觉行为相关。使用受先前两项工作启发的探测技术,我们分析了隐藏层、注意力层和 MLP 层的激活,以及跨预定义任务的输出 logits。我们在幻觉检测基准上探测了 LLaMA-3-8B,在知识冲突数据集上探测了 Falcon-7B。我们的研究结果表明,尽管在概念上相关,但幻觉激活模式不能完全还原为知识冲突表征或通过知识冲突表征来解释。尽管如此,探测被证明是一种跨多种语言和激活类型的强大工具,支持其在提高 LLM 可解释性方面的作用。这项工作增进了对 LLM 中幻觉的更广泛理解,并强调了对其内部行为进行细粒度分析的价值。