论文

核函数词元矛盾:LLM 声明不确定性量化的快速且有原则的方法

Kernel Token Contradiction: a Fast and Principled Approach for LLM Claim Uncertainty Quantification

模型评测评测方法与指标

摘要

声明级不确定性量化 (UQ) 旨在通过评估输出中每个声明的真实性来缓解 大语言模型 (LLM) 可靠性的缺乏。我们引入了内核词元矛盾(KTC),这是一种在现实白盒条件下计算声明级 UQ 的轻量级方法。 KTC 将 LLM 生成中涉及的候选词元表示为正半定核,该核集成了 LLM 的条件分布和词元矛盾分数。然后,我们使用冯诺依曼熵来量化该内核的不确定性。为了估计词元矛盾,我们开发了一种基于维基百科语料库频率统计的新方法。虽然仅使用 CPU,但与基于交叉编码器的最先进的 GPU 加速方法相比,我们的方法实现了超过 8.2 倍的加速,与性能相当的仅使用 CPU 的方法相比,加速超过 65 倍。我们的评估涵盖四种欧洲语言和 16 种不同模型的两个基准。 KTC 不仅与现有方法的平均性能相当,而且在高精度方面也优于现有方法。这种计算效率和准确性的结合使得 LLM 输出的实时监控在生产中变得实用。