论文
当错误的钥匙获胜时:理解和检测大语言模型的幻觉
When the Wrong Key Wins: Understanding and Detecting Hallucinations in LLMs
摘要
即使正确答案所需的知识已经存在,大型语言模型也可能会产生幻觉。我们通过潜在关键推理视图来研究这种失败,其中答案选择取决于预训练期间获得的关联之间的竞争。我们表明,模型预测对单个查询关键字高度敏感,这些有影响力的关键字表现出特定于实体的绑定,并且它们的效果由预训练频率系统地影响。多个绑定还可以在同一查询中竞争并表现出更高阶的交互。基于这种机制,我们引入了一种用于幻觉检测的两阶段关键词扰动方法。通过删除有影响力的关键词并测量模型如何重新组织其预测,该方法可以区分由误导性关键关联引起的错误与由诊断证据支持的正确决策。在多个模型和基准测试中,扰动提供了强大且可转移的检测信号,在探针已知的 ScientistQA 上达到 0.910 美元 AUROC。最后,我们将相同的概率框架扩展到四种幻觉状态:知识缺乏、错误知识、上下文干扰和不稳定的推理。它们在基准测试中的操作分布为不同探测器系列在不同设置中取得成功的原因提供了诊断背景。