论文
推理的热力学特征:大语言模型 中幻觉检测的自由能和谱形因子诊断
Thermodynamic Signatures of Reasoning: Free-Energy and Spectral-Form-Factor Diagnostics for Hallucination Detection in Large Language Models
摘要
大语言模型 (LLM) 中的幻觉检测对于部署至关重要,最近的工作表明,注意力衍生图拉普拉斯的频谱携带着有关推理质量的强烈信号。然而,之前的谱诊断通过一些特征值或手工挑选的标量来总结拉普拉斯谱,而其大部分结构未被使用。我们提出了自由能签名(Fes),这是一种光谱描述符,它将每一层的注意力拉普拉斯算子视为哈密顿量,并提取其热力学势分配函数、自由能、谱熵、热容以及随机矩阵理论(RMT)光谱形状因子。我们证明了三个结果:(i)~Fes 在注意力扰动下的 Lipschitz 稳定性; (ii)〜表现力结果表明,Fes 丰富了有限谱摘要,并在明确的规律性和网格分辨率假设下近似矩导出谱泛函; (iii)~一个有限样本 PAC,绑定在由 Fes 构建的 无需训练 探测器的 AUROC 上。根据经验,在六个开放权重 LLM 和六个基准测试中,Fes 描述符上的轻量级探针在注意力谱基线中实现了最强的聚合 AUROC,比 LapEig 平均提高了 $+6.5$ AUROC 点,比 GoR-4 平均提高了 $+2.4$ 点,同时不需要更新底层 LLM。在完全无监督的设置中,RMT 偏差得分达到平均 AUROC $0.71$,提供了无标签但较弱的检测器。补充 RMT 分析表明,正确的世代表现出更多类似维格纳-戴森的光谱统计数据,而幻觉则表现出更多类似泊松的统计数据。补充材料中提供了匿名代码和配置。