论文

为什么 LLM 对结构化知识产生幻觉:线性化表示推理的机制分析

Why LLMs Hallucinate on Structured Knowledge: A Mechanistic Analysis of Reasoning over Linearized Representations

模型评测模型行为与机制分析

摘要

在许多推理任务中,大语言模型 (LLM) 依赖于结构化的外部知识,例如图形和表格,这些知识通常被线性化为顺序标记表示。然而,即使有足够的知识,LLM 仍然可以产生幻觉输出,并且此类故障背后的潜在机制仍然知之甚少。我们研究了这些机制,发现幻觉是由系统的内部动态而不是随机噪声引起的。首先,注意力不成比例地集中在类似捷径的结构线索上,而不是分布在整个上下文中。其次,前馈表示无法奠定所提供的知识,导致模型恢复到参数记忆。此外,我们的结果表明,幻觉始终与前馈层内语义基础的失败相关,而注意力分配则表现出更大的任务依赖性可变性。最后,我们表明这些机械模式超越单跳图推广到多跳和表格设置,从而能够跨结构化知识格式进行有效的幻觉检测。