论文

大语言模型中的溢出能量

Spilled Energy in Large Language Models

模型评测评测方法与指标

摘要

我们将最终的大语言模型(LLM)softmax 分类器重新解释为基于能量的模型(EBM),在推理时将序列到序列的概率链分解为多个相互作用的 EBM。这种原则性的方法使我们能够在解码过程中跟踪“能量溢出”,我们凭经验证明这与事实错误、偏见和失败相关。与 Orgad 等人类似。 (2025),我们的方法定位了确切的答案标记,并随后测试幻觉。然而,至关重要的是,我们不需要经过训练的探针分类器或激活消融就可以实现这一目标。相反,我们引入了直接从输出逻辑衍生的两个完全免训练的指标:溢出能量,它捕获理论上应该匹配的连续生成步骤之间的能量值之间的差异,以及边缘化能量,它可以在单个步骤中测量。通过对最先进的大语言模型(包括 LLaMA、Mistral 和 Gemma)和合成代数运算 (Qwen3) 的九个基准进行评估,我们的方法展示了强大的、有竞争力的幻觉检测和跨任务泛化。值得注意的是,这些结果适用于预训练和指令调整的变体,而不会引入任何训练开销。

大语言模型中的溢出能量
图2:LLM中能量如何外溢。(a)语言建模p(𝐱_{i:1})作为遵循概率链式法则的分解问题获得,以自回归方式实现:我们在词表𝒱上递归地应用判别式分类器,以实现具有更大上下文规模的生成式建模,即p(𝐱_i|𝐱_{i-1:1})。(b)我们将每个判别式分类器重新解释为生成式EBM,发现两个在时间步之间本应相同却彼此不同的量之间存在联系。我们将这一差异称为式8中的“外溢能量”(spilled energy)ΔE_𝜽(𝐱_{i:1})。(c)由于我们只是读取LLM内部的数值,我们的方法无需训练,且在一个难度递增的合成数学数据集上与幻觉高度相关;(d)Llama-3-Instruct使用min池化时,在全部九个数据集上错误答案与正确答案的外溢能量值直方图。两种分布用简单阈值即可轻松分开,从而实现跨真实世界任务的泛化。