论文
量化大型推理模型中忠实的置信度表达
Quantifying Faithful Confidence Expression in Large Reasoning Models
摘要
可靠的不确定性通信对于 LLM 的可信度至关重要,但忠实校准 (FC)——模型内在和(语言上)表达的置信度之间的一致性——是一种持久的故障模式。这一挑战对于大型推理模型 (LRM) 来说至关重要,其扩展推理轨迹通常被用户解释为深思熟虑、能力和信心的证据。尽管 FC 很重要并且 LRM 被广泛使用,但 LRM 能够在多大程度上忠实地表达他们的信心仍然知之甚少。此外,衡量 FC 的主流范式不能很好地推广到 LRM 生成的长思想链输出,这些输出往往缺乏清晰的步骤边界,涉及不一致的步骤结构,并在整个跟踪中编码复杂的条件依赖关系,从而使内在置信度的估计变得复杂。为了应对这一挑战,我们引入了一种新颖的框架来系统地量化 LRM 的 FC。我们的框架基于标记概率、隐藏状态和采样响应一致性来分析相对于三个内部不确定性来源的语言决定性。我们还设计了一种前缀条件采样方法来控制痕迹之间的条件和结构变化。将我们的框架应用到各种领先模型、数据集和提示中,我们发现忠实的置信度表达对于 LRM 来说是一个重大挑战。推理行为不会自动转化为改进的 FC,并且对非推理模型的及时干预不会改进推理设置中的 忠实性。不同的置信估计器进一步对相同的痕迹产生不同的评估,揭示了先前评估方法的脆弱性。总而言之,我们的工作将 FC 确立为 LRM 的独特可靠性和一致性目标,特别是因为此类系统越来越多地部署在高风险环境中。