论文
概率是不够的:探索和计算发散标记以推理大语言模型中的不确定性量化
Probability is Not Enough: Exploring and Counting Divergent Tokens for Reasoning Uncertainty Quantification in LLMs
摘要
随着大语言模型的思想链推理能力的提高,评估和校准其推理置信度对于量化其答案的不确定性变得越来越重要。目前估计大语言模型置信度的方法通常基于所选关键标记的概率,但其底层机制仍不清楚。我们的试点研究发现,用粗略替代品替换选定的标记概率也可以改善校准,激励我们进一步探索模型置信度的有效信号。我们引入了发散词元置信度(DTC),这是一个通过计算解码过程中两个模型强烈不一致的词元来估计置信度的框架。 DTC 使用沿着相同推理轨迹评估的下一个标记分布之间的 Jensen-Shannon 散度来识别这些发散的标记。我们发现它们的计数几乎与答案准确性负相关,从而可以作为不确定性量化的简单而有效的信号。 DTC 支持使用辅助模型进行白盒和黑盒评估,无需显式训练,不影响生成过程。跨多个模型系列和六个数学基准的实验表明,相对于基于概率和语言化的基线,校准得到了改进。在白盒评估下,仅计数估计器的平均预期校准误差为 13.0%,而标准全序列置信方法的平均预期校准误差为 32.7%-42.4%。在黑盒设置中,它还改进了原始语言分数的校准。例如,DeepSeek-V3.2 上的平均预期校准误差从 32.1%-40.2% 降至 13.7%-16.3%。这些发现为改进大语言模型中的推理不确定性量化提供了新的见解。代码发布于https://github.com/szu-tera/DTC.git.