论文
CALIBRE:校准语言模型推理前后的置信度
CALIBER: Calibrating Confidence Before and After Reasoning in Language Models
摘要
越来越多的人要求推理语言模型不仅要回答困难的问题,还要估计其成功的可能性。现有的方法通常只能激发一次信心:要么在思考之前,要么在回答之后。我们认为,推理模型的置信度是依赖于状态的:在思考之前,置信度应该估计模型正确解决提示的机会,而在思考之后,它应该预测实现的答案是否可能是正确的。这种区别决定了适当的监督目标:提示级别的成功应该监督看到提示后做出的置信度估计,而个人答案级别的正确性应该监督回答后做出的置信度估计。我们引入了 CALIBRE(推理前后校准),它可以根据与其信息状态匹配的目标来引出估计和监督。在此统一协议下,CALIBRE 将 7B 模型的预期校准误差 (ECE) 比 BigMathDigits 上最强的单置信度基线降低了 52.5%,同时实现了最佳 Brier 分数和 AUROC,并且与最佳精度保持在 2.1 分之内。此外,在更大的 30B 模型上,CALIBRE 在 BigMathDigits 上实现了最佳 ECE,同时在 Brier 分数和 AUROC 方面保持竞争力。在发行后,它在 GPQA 和 TriviaQA 上获得了最佳 ECE 和 Brier 分数,并且在 SimpleQA 上保持了竞争力。消融进一步表明,这种位置-目标对齐在分布偏移下最为有利,它可以持续减少所有分布外基准的校准误差。