论文
一个不完美的验证者就足够了:用嘈杂的奖励学习
An Imperfect Verifier is Good Enough: Learning with Noisy Rewards
摘要
具有可验证奖励的强化学习(RLVR)广泛用于 后训练 大语言模型,但实际验证者可能会犯错误。我们研究了奖励噪声的速率和结构如何影响代码生成中的 RLVR,并进行了初步的科学推理检查。在 MBPP 的多种子 Qwen3 8B 实验中,在测试的重采样组内轨迹噪声率达到 20% 时,两次固定后期评估的平均验证奖励在干净基线的 1 个百分点以内,在 30% 时在约 2 个百分点以内。置信区间允许较大的损失;这些点估计并未建立一般的容忍阈值。我们还检查了全程序 pass@k、四个受控噪声结构、两个基于模型的验证器以及来自跨越 4B-9B 参数的三个系列的策略模型。我们推导了对称和非对称组噪声的条件优势分布,包括保留的格式惩罚,并说明了为什么裁剪限制了简单的梯度缩放参数。该分析确定了整个群体腐败所保留的信息,以及将我们的不对称扫描解释为精确召回比较的限制。总体而言,结果表明,不完善的验证可以在测试设置中支持有效的 RLVR,而单独的总错误率并不能表征学习信号。