论文

当正确遇上错误:面向GRPO的双边上下文条件化与奖励-置信度校正

When Right Meets Wrong: Bilateral Context Conditioning with Reward-Confidence Correction for GRPO

模型训练强化学习RLVR

摘要

组相对策略优化(GRPO)已成为训练推理模型的一种有效方法。尽管GRPO基于组均值计算优势,它在优化时将每个输出视为独立样本,忽视了一个至关重要的结构性信号:同一组内正确解答与错误解答之间的天然对比,从而忽略了那些可以通过将成功推理轨迹与失败推理轨迹显式对照加以利用的丰富比较数据。为利用这一点,我们给出GRPO的一种对比式重述,表明GRPO目标隐式地最大化正确样本与错误样本策略比率之间的间隔。基于这一洞见,我们提出双边上下文条件化(BICC),一种让模型在优化过程中交叉参照成功与失败推理轨迹的机制,实现样本之间的直接信息流动。我们进一步提出奖励-置信度校正(RCC),利用由方差最小化估计量的一阶近似导出的奖励-置信度协方差动态调整GRPO中的优势基线,从而稳定训练。两种机制均无需额外采样或辅助模型,且可适配所有GRPO变体。在数学推理基准上的实验表明,跨各类模型与算法均取得一致改进。代码发布于https://github.com/Skylanding/BiCC。

当正确遇上错误:面向GRPO的双边上下文条件化与奖励-置信度校正:论文配图
图 1:所提出方法的概述。标准GRPO管道通过策略模型处理查询qq以生成GG输出,该输出通过奖励模型进行评分并标准化以计算策略梯度更新的优势。 BiCC 按奖励对输出进行分区,并将每个样本置于相反分区的输出上,从而实现跨分区信息流,其中正确和错误的尝试相互通知。 RCC 计算奖励和对数概率变化之间的协方差以纠正优势估计。