论文
幻觉作为承诺失败:尽管知道答案,但更大的 LLM 失火
Hallucination as Commitment Failure: Larger LLMs Misfire Despite Knowing the Answer
摘要
幻觉通常被视为知识缺失的直接后果:当正确答案在其生成时间分布中不存在时,模型会错误地回答,而当正确答案存在时,模型会正确回答。我们通过引入答案可用性的语义概念来测试这个假设,该概念聚合了表达相同答案概念的 词元级 变体,并询问模型提交答案时是否已经存在正确的概念。在 Instruct 和 Base 变体中从 0.8B 到 72B 的 Qwen 和 Llama 模型中,16-47% 的 Instruct 幻觉发生的概率质量已经处于正确的概念上,并且该比率随规模单调上升。将此类失败与具有匹配语义支持的正确生成进行比较,区别因素不在于是否表示了正确的概念,而在于其概率如何分布:正确生成将质量集中在单个表面形式上,幻觉将其分散在替代方案中。同样的锐化不对称性延伸到多词元生成中,并且可以在生成前的隐藏状态中检测到。总之,这些结果确定了一个机制:指令调整随着规模的扩大而增强了答案承诺,使帮助和自信幻觉成为同一潜在倾向的两种结果。