论文

注意力集中作为 大语言模型 中幻觉检测的内部信号

Attention Sinks as Internal Signals for Hallucination Detection in Large Language Models

模型评测评测方法与指标

摘要

大语言模型 经常表现出幻觉:流畅且自信的输出实际上是不正确的或不受输入上下文的支持。虽然最近的幻觉检测方法已经探索了从注意力图衍生的各种特征,但它们利用的潜在机制仍然知之甚少。在这项工作中,我们提出了 SinkProbe,一种幻觉检测方法,其基础是观察到幻觉与注意力池(在生成过程中积累不成比例的注意力质量的标记)深深纠缠在一起,表明从分布式、基于输入的注意力到压缩的、先验主导的计算的转变。重要的是,尽管汇得分仅根据注意力图计算,但我们发现分类器优先依赖于其相关值向量具有较大范数的汇。此外,我们通过建立注意力池与注意力池分数的数学关系来证明以前的方法隐含地依赖于注意力池。我们的研究结果产生了一种基于理论的新颖的幻觉检测方法,该方法可以在流行的数据集和 LLM 上产生最先进的结果。