论文

统一正确的策略优化:打破RLVR对多样性的冷漠

Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity

模型训练强化学习

摘要

具有可验证奖励的强化学习 (RLVR) 在推理任务的单次尝试准确性 (Pass@1) 方面取得了显着的进步,但经常受到多样本覆盖率 (Pass@K) 减少的影响,表明多样性崩溃。我们确定了这种退化的结构性原因:常见的 RLVR 目标(例如 GRPO)对于概率质量在正确解决方案之间的分布方式并不关心。与随机训练动态相结合,这种冷漠会导致自我强化崩溃,其中概率质量集中在正确输出的狭窄子集上,而替代有效解决方案则受到抑制。我们形式化了这种崩溃机制,并在两个互补标准下进一步描述了最优策略结构:鲁棒性和熵正则化最优性,这将统一正确策略确定为唯一最优的。受此分析的启发,我们提出了统一正确策略优化(UCPO),这是对 GRPO 的修改,它对正确解决方案的策略分布添加了条件均匀性惩罚。惩罚将梯度信号重新分配给代表性不足的正确响应,从而鼓励在正确集合内统一分配概率质量。在三个模型(1.5B-7B 参数)和五个数学推理基准中,UCPO 改进了 Pass@K 和多样性,同时保持了具有竞争力的 Pass@1,在 Pass@64 上实现了 AIME24 高达 +10\% 的绝对改进,并在正确的集合内实现了高达 45\% 的方程级多样性。该代码可在 https://github.com/AnamikaLochab/UCPO 获取。