论文

LLM 通过自适应共形语义熵进行不确定性量化

LLMs Uncertainty Quantification via Adaptive Conformal Semantic Entropy

模型评测鲁棒性、公平性与可信度评测

摘要

LLM 的过度自信,特别是在产生幻觉时,对模型在安全关键环境中的部署提出了重大挑战,并且需要对不确定性进行可靠的估计。现有的不确定性量化方法通常优先考虑词汇或概率测量;然而,这些技术常常忽略具有相似含义的不同响应的语义差异。在本文中,我们提出了自适应共形语义熵(ACSE),这是一种通过自适应测量 LLM 输出中的语义分散来估计提示级不确定性的方法。我们的不确定性评分函数基于对同一提示的多个不同响应的聚类语义熵。该函数根据每个簇的语义特征自适应地调整不确定性得分。为了确保分数的统计可靠性,我们使用保形校准来应用决策规则来接受/放弃提示,提供有限样本、无分布保证,以便接受的响应之间的错误率保持在用户指定的容差范围内。我们使用不同的 LLM 和数据集进行的广泛实验评估表明,我们的方法始终优于使用判别性能、保形保证和概率校准指标的最先进的不确定性量化基线。值得注意的是,对于 TriviaQA 数据集,我们方法的 AUROC 为 0.88,而词元熵方法产生的 AUROC 为 0.65。