论文

LogitScope:通过信息度量分析LLM不确定性的框架

LogitScope: A Framework for Analyzing LLM Uncertainty Through Information Metrics

模型评测评测方法与指标

摘要

理解并量化大语言模型(LLM)输出中的不确定性对可靠部署至关重要。然而,传统评估方法对生成过程中各个token位置上的模型置信度提供的洞察有限。为解决这一问题,我们提出LogitScope,一个通过从概率分布计算的token级信息度量来分析LLM不确定性的轻量框架。通过在每个生成步骤度量熵(entropy)与varentropy(方差熵)等指标,LogitScope揭示模型置信度的模式、识别潜在幻觉,并暴露模型呈现高不确定性的决策点,全程无需标注数据或语义解释。我们展示了LogitScope在不确定性量化、模型行为分析与生产监控等多种应用中的效用。该框架与模型无关,通过惰性求值实现计算高效,并兼容任何HuggingFace模型,使研究人员与从业者都能在推理过程中检视LLM行为。

LogitScope:通过信息度量分析LLM不确定性的框架:论文配图
图 1:熵与变熵散点图。每个点代表一个token位置,左下角表示置信预测,右上角表示多模态不确定性。表 1:《独立宣言》序言的平均指标(原始顺序与单词倒序顺序)。颠倒词序会破坏连贯性,从而大大增加不确定性。