论文
RL-ARC:以推理置信度改善推理模型校准
RL-ARC: Calibrating Large Reasoning Models via Reasoning-guided Uncertainty
摘要
语言模型 (LM) 通常使用具有可验证奖励的强化学习 (RLVR) 进行训练,以增强其推理能力。然而,由于 RLVR 在训练期间没有明确考虑校准,因此可能导致严重的校准退化,包括过度自信。最近的 LM 校准感知训练方法将不确定性估计的目标纳入训练中,改进了校准,但在分布偏移下仍然表现出过度自信,同时牺牲了推理性能。为此,我们提出了 RL-ARC,这是一种校准感知训练框架,联合利用推理置信度和答案置信度。具体来说,RL-ARC 利用推理置信度作为校准答案置信度的辅助信号,将其用作正确案例的推理引导正则化以及错误案例的过度自信惩罚。 ID 和 OOD 设置的综合结果表明,除了改进校准之外,RL-ARC 还使推理模型能够根据给定问题自适应地估计置信度,而无需 大大牺牲了推理性能,从而凸显了推理置信度对于训练可靠推理模型的重要性。