论文
大语言模型中的溢出能量
Spilled Energy in Large Language Models
摘要
我们将最终的大语言模型(LLM)softmax 分类器重新解释为基于能量的模型(EBM),在推理时将序列到序列的概率链分解为多个相互作用的 EBM。这种原则性的方法使我们能够在解码过程中跟踪“能量溢出”,我们凭经验证明这与事实错误、偏见和失败相关。与 Orgad 等人类似。 (2025),我们的方法定位了确切的答案标记,并随后测试幻觉。然而,至关重要的是,我们不需要经过训练的探针分类器或激活消融就可以实现这一目标。相反,我们引入了直接从输出逻辑衍生的两个完全免训练的指标:溢出能量,它捕获理论上应该匹配的连续生成步骤之间的能量值之间的差异,以及边缘化能量,它可以在单个步骤中测量。通过对最先进的大语言模型(包括 LLaMA、Mistral 和 Gemma)和合成代数运算 (Qwen3) 的九个基准进行评估,我们的方法展示了强大的、有竞争力的幻觉检测和跨任务泛化。值得注意的是,这些结果适用于预训练和指令调整的变体,而不会引入任何训练开销。
