论文
通过内部注意力发散信号检测 大语言模型 中的幻觉
Detecting Hallucinations in Large Language Models via Internal Attention Divergence Signals
摘要
我们提出了一种轻量级、单通道不确定性量化方法,用于检测 大语言模型 中的幻觉。该方法使用注意力矩阵来估计不确定性,而不需要重复采样或外部模型。具体来说,我们测量每个注意力头分布和均匀参考分布之间的 Kullback-Leibler 散度,并在逻辑回归探测中使用这些特征。在多个数据集、任务类型和模型系列中,注意力分散可以高度预测答案的正确性,并且与现有的不确定性估计方法相比具有竞争力。我们发现该信号集中在中间层和事实标记(例如命名实体和数字)上,这表明注意力动态提供了模型不确定性的有效且可解释的白盒信号。