论文

用于推理的校准感知策略优化 LLM

Calibration-Aware Policy Optimization for Reasoning LLMs

模型训练强化学习

摘要

组相对策略优化 (GRPO) 增强了 LLM 推理,但常常会导致过度自信,其中不正确的响应产生的困惑度低于正确的响应,从而降低了曲线下面积 (AUC) 所描述的相对校准。现有方法要么对校准产生有限的改进,要么牺牲推理准确性的收益。我们首先证明 GRPO 式算法的这种退化源于其与不确定性无关的优势估计,这不可避免地使优化梯度与校准不一致。这会提高精度,但代价是校准性能下降。然后,我们提出校准感知策略优化(CAPO)。它采用理论上一致的逻辑 AUC 替代损失,并承认后悔界限,从而实现不确定性感知优势估计。通过进一步结合噪声掩蔽机制,CAPO 实现了稳定的学习动态,共同优化了校准和准确性。在多个数学推理基准上的实验表明,CAPO-1.5B 将校准显着提高了高达 15%,同时实现了与 GRPO 相当或更好的精度,并将下游推理时间扩展任务的精度进一步提高了高达 5%。此外,当允许在低置信度条件下放弃时,CAPO 实现了帕累托最优精度覆盖权衡,凸显了其缓解幻觉的实际价值。