论文
正确解反复出现时:GRPO的稀有性感知信用重分配
When Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPO
摘要
强化学习中的可验证奖励(RLVR)通常优化每个正确的完成作为独立的学习信号。在GRPO中,这种完成级别的统一性导致结构级别偏差:重复的正确解决方案形成的比例与其被采样次数成正比的积极系数累积体,而罕见的解决方案则受到有限的信用。我们将其行为形式化为多模态诱导的结构级信用集中,并引入一个条件分区规则,该规则根据簇稀疏性重新分配积极优势。Cue-GRPO通过使用确定性的策略线索来构造验证正确的轨迹局部分区,从而在Qwen2.5-Math-7B和Llama-3.1-8B-Instruct上进一步改进了AIME重复采样性能,特别是在高采样预算时取得最大收益。信用分配(CR)在Judge Partitions(JP)下进一步表明,提出的重新分配机制可以在判别器衍生的分区中操作。Cue-GRPO仅增加了6%的墙钟训练时间超时。这些结果支持结构级信用重新分配作为强化学习中的RLVR设计轴,而策略线索提供了一个低延迟的实现方式来竞争数学。代码可在https://github.com/CzZ12/When-Correct-Solutions-Repeat-Rarity-Aware-Credit-Redistribution-for-GRPO处获取。
