论文

正确解反复出现时:GRPO的稀有性感知信用重分配

When Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPO

模型训练强化学习RLVR

摘要

强化学习中的可验证奖励(RLVR)通常优化每个正确的完成作为独立的学习信号。在GRPO中,这种完成级别的统一性导致结构级别偏差:重复的正确解决方案形成的比例与其被采样次数成正比的积极系数累积体,而罕见的解决方案则受到有限的信用。我们将其行为形式化为多模态诱导的结构级信用集中,并引入一个条件分区规则,该规则根据簇稀疏性重新分配积极优势。Cue-GRPO通过使用确定性的策略线索来构造验证正确的轨迹局部分区,从而在Qwen2.5-Math-7B和Llama-3.1-8B-Instruct上进一步改进了AIME重复采样性能,特别是在高采样预算时取得最大收益。信用分配(CR)在Judge Partitions(JP)下进一步表明,提出的重新分配机制可以在判别器衍生的分区中操作。Cue-GRPO仅增加了6%的墙钟训练时间超时。这些结果支持结构级信用重新分配作为强化学习中的RLVR设计轴,而策略线索提供了一个低延迟的实现方式来竞争数学。代码可在https://github.com/CzZ12/When-Correct-Solutions-Repeat-Rarity-Aware-Credit-Redistribution-for-GRPO处获取。

正确解反复出现时:GRPO的稀有性感知信用重分配:论文配图
图 1:Cue-GRPO 信用再分配机制示意图。二进制验证器首先区分正确和错误的部署。策略提示将经过验证的正确轨迹划分为提示定义的簇,并且每个正确的推出均按 |Ci|−α|C_{i}|^{-\alpha} 加权。这改变了来自 MC∝|C|M_{C}\propto|C| 的集群级正信用在普通 GRPO 中,将其转换为 MC∝|C|1−αM_{C}\propto|C|^{1-\alpha},减少多重性驱动的浓度,同时保留有限群稳定之前的总正系数质量。不正确的部署保留了其原有的负面优势,而由此产生的优势进入了标准 GRPO 目标。 4:2:14{:}2{:}1 分区是说明性的。