论文
量化 RLVR 中的经验计算监督权衡
Quantifying Empirical Compute-Supervision Tradeoffs in RLVR
摘要
具有可验证奖励的强化学习(RLVR)已成为 后训练 语言模型的标准范例,但在实践中,验证者很少是完美的。最近的理论工作预测,验证者噪声会影响学习速度,但不会影响其最终结果,这意味着足够的计算应该可以弥补由不完善的监督引起的任何差距。我们通过 后训练 Qwen2.5 (0.5B, 1.5B) 和 GSM8K 上的 GRPO 来实证测试这一预测,同时将受控的假阳性和假阴性噪声注入到二进制正确性信号中,并将每个提示的不同滚动次数作为计算轴。实际上,在大量计算扩展的情况下,验证准确性的差距仍然存在,计算回报急剧下降。我们进一步发现了一种结构不对称性,其中假阴性比假阳性更快地单调降低性能。这些发现表明验证者质量和训练计算是不可互换的,并且减少误报是比单独扩展计算更有效的杠杆。