论文
当正确遇上错误:面向GRPO的双边上下文条件化与奖励-置信度校正
When Right Meets Wrong: Bilateral Context Conditioning with Reward-Confidence Correction for GRPO
摘要
组相对策略优化(GRPO)已成为训练推理模型的一种有效方法。尽管GRPO基于组均值计算优势,它在优化时将每个输出视为独立样本,忽视了一个至关重要的结构性信号:同一组内正确解答与错误解答之间的天然对比,从而忽略了那些可以通过将成功推理轨迹与失败推理轨迹显式对照加以利用的丰富比较数据。为利用这一点,我们给出GRPO的一种对比式重述,表明GRPO目标隐式地最大化正确样本与错误样本策略比率之间的间隔。基于这一洞见,我们提出双边上下文条件化(BICC),一种让模型在优化过程中交叉参照成功与失败推理轨迹的机制,实现样本之间的直接信息流动。我们进一步提出奖励-置信度校正(RCC),利用由方差最小化估计量的一阶近似导出的奖励-置信度协方差动态调整GRPO中的优势基线,从而稳定训练。两种机制均无需额外采样或辅助模型,且可适配所有GRPO变体。在数学推理基准上的实验表明,跨各类模型与算法均取得一致改进。代码发布于https://github.com/Skylanding/BiCC。
