论文

当信心信号不一致时:自回归语言模型中的局部和全局信心

When Confidence Signals Disagree: Local and Global Confidence in Autoregressive Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

现代预测系统揭示了通常被解释为置信度度量的多个量。然而,这些量可以概括预测过程的不同方面。当信心用于评估可靠性或通知下游监督和控制时,这种区别很重要。我们通过比较局部置信度(根据贪婪选择的答案标记的概率定义)与全局置信度(根据重复采样下的模态答案频率定义),研究不同置信度读数在自回归语言模型中是否可以在经验上互换。在 MMLU 和 ARC Challenge 中,这两个信号相关性较弱,并且与正确性的关联存在显着差异:全局置信度与正确性适度相关,而局部置信度几乎没有关联。我们进一步测试信号之间的问题级分歧是否与采样不稳定相关。在 ARC 上,较大的局部-全局置信差距与较高的答案熵、更独特的采样答案和较低的模态答案集中度相关。当从不相交的随机样本估计不一致和不稳定性时,间隙-熵关联仍然存在,这表明它不能用共享的有限样本变异来解释。 MMLU 上的对应关系要弱得多,只有 4% 的问题表现出抽样不稳定。这些结果表明,从同一预测系统得出的置信度读数在经验上不可互换,并且它们的分歧可以提供不稳定采样行为的诊断。因此,置信度应被视为明确定义的度量,而不是模型的单个内在标量属性,特别是当它用于通知下游评估、监督或控制时。