论文

Probe-SD:将内部置信信号蒸馏为模型自身的校准输出

Calibration, Not Answer Selection: Distilling Internal Confidence in Reasoning Models

摘要

具有二元正确性奖励的强化学习训练的是正确性,而不是校准的置信度。推理模型用语言表达的信心在系统上是过度自信的,而且问题不仅仅是规模问题:语言表达的信心跟踪的是模型致力于给出答案的意愿,而不是答案正确的可能性有多大。因此,事后重新调整适合一种分布,但很少转移。我们改为查看模型内部。在事实问答中,对思维链和答案之间隐藏状态的线性探针的校准效果要好得多:其预期校准误差比四个基准和两个模型系列的语言分数低 5 到 38 倍。然而,当用于在 N 个样本答案中进行选择时,相同的探测几乎与多数投票挂钩,但与预言机相差甚远。内部状态很好地回答了“我有多确定”而回答了“哪个答案是正确的”,因此应该将信号报告为置信度,而不是用于选择答案。因此,我们引入了探针引导的自蒸馏(Probe-SD):使用探针对模型自己的采样轨迹进行评分,覆盖每个轨迹状态的置信度,并微调同一族的基本检查点,因此在测试时除了模型本身之外什么都保留。在 Qwen3-14B 上,Probe-SD 将域内 ECE 从 0.178 削减至 0.024,将域外 ECE 从 0.542 削减至 0.113,同时还击败了事后重新校准和自洽蒸馏。由此产生的置信度经过良好校准,对于加权投票非常有用,这些行为之前归因于在线强化学习,这里仅通过监督微调获得。