论文
理解语言模型为何产生幻觉:根据先验测试推理
Understanding Why Language Models Hallucinate: Testing Reasoning Against Priors
摘要
大语言模型 经常会产生违反提示级别限制的幻觉答案。一个关键的诊断问题是这些失败是否反映了知识的缺失,或者模型是否具有相关信息但遵循了错误的推理路径。我们将这种现象研究为推理失调:提示支持的答案与统计上显着的潜在关联所青睐的答案之间的不匹配。我们用潜在关键任务模型形式化了这一观点,其中预训练频率不平衡会导致捷径路径主导约束敏感路径并导致正推理损失。该框架预测了两种失败模式:实体消歧中的任务检索偏差和动作选择中的键选择偏差。我们推出 TrapQA,这是一个包含两个组件的受控诊断测试平台。 ScientistQA 通过补充事实探究来测试类似科学家之间的歧义消除,而 Real-Life Constrained QA 则测试在显着捷径下遵循的日常约束。我们的结果表明,幻觉可能源于有偏见的潜在推理,而不仅仅是缺乏知识。