论文

校准 LLM 推理置信裕度的过程监督

Process Supervision of Confidence Margin for Calibrated LLM Reasoning

模型训练奖励建模与过程监督

摘要

通过强化学习 (RL) 扩展测试时间计算已成为提高 大语言模型 (LLM) 推理能力的可靠途径。然而,基于结果的奖励通常会激励模型过度自信,从而导致幻觉、不可靠的基于置信度的控制以及不必要的计算分配。我们引入了带有置信裕度的强化学习 (RLCM),这是一种校准感知的 RL 框架,它通过对中间预算完成情况的裕度增强过程奖励来共同优化正确性和置信可靠性。 RLCM 不是将置信度与正确性可能性保持一致,而是鼓励模型扩大单个推理轨迹内正确步骤和错误步骤之间的置信区间。在数学、代码、逻辑和科学基准方面,我们的方法大大改进了校准,同时保持或提高了准确性。我们进一步表明,通过校准的置信信号,生成的模型可以实现更有效的保形风险控制和有效的置信加权聚合