论文

熵分布作为生成模型幻觉的指纹

Entropy Distribution as a Fingerprint for Hallucinations in Generative Models

模型评测评测方法与指标

摘要

大语言模型(LLM)常常生成事实性错误的输出——通常称为幻觉——这削弱了信任并限制了在高风险场景中的部署。现有幻觉检测方法通常需要多次前向传播,或需要访问模型内部。在本工作中,我们提供理论依据与经验证据,表明词元级熵的分布——超出困惑度或长度归一化熵所捕捉的均值之外——可作为幻觉的指纹,其分布形状与尾部行为携带独立信号。我们将幻觉检测形式化为统计假设检验,并提出校准熵分数(CES),一个只需单次前向传播和词元logit黑盒访问的轻量算法。CES通过一个经校准的参考累积分布函数(CDF)将生成熵的均值信号与最大值信号相结合,产出的分数可直接跨模型、跨任务比较。我们通过一个新颖的随机长度Dvoretzky--Kiefer--Wolfowitz不等式建立有限样本校准保证,并证明CES检测出幻觉的概率随生成长度呈指数速度收敛于1。在覆盖开源与API访问模型的八个问答基准和十个生成模型上,CES在所有单次前向的黑盒方法中取得最高检测性能,同时提供了现有启发式方法所缺乏的正式误差保证。值得注意的是,CES与需要高得多的计算成本的多样本方法在统计上不可区分,弥合了轻量检测与昂贵检测之间的差距,使其适合实时、大规模的部署。

熵分布作为生成模型幻觉的指纹:论文配图
图 5:18,705 个序列的标记熵自相关分析。 (a) lag-1 ACF 的分布;中位数 ρ1=0.061\rho_{1}=0.061,远低于关注阈值。 (b) Lag-1 与 lag-2 自相关散布;二阶相关性较弱(中位数 ρ2≈0.03\rho_{2}\approx 0.03)。 (c) 有效样本量比neff/nn_{\text{eff}}/n;大多数序列保留>>80% 的有效样本。只有 15.8% 的序列具有 |ρ1|>0.3|\rho_{1}|>0.3,从而大大减少了有效样本量。