论文

削波瓶颈:通过近边界信号的随机恢复稳定 RLVR

Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals

模型训练强化学习

摘要

带可验证奖励的强化学习 (RLVR) 已成为扩展 LLM 推理的核心范式,但其优化经常受到训练不稳定和收敛欠佳的影响。通过对基于裁剪的 GRPO 式目标的系统剖析,我们将硬裁剪引起的刚性裁剪决策确定为所研究的 RLVR 设置中的关键实际瓶颈。具体来说,我们的分析表明,信息信号可能位于刚好超出限幅阈值的近边界区域,因此被标准硬限幅规则丢弃。值得注意的是,一旦精确识别了这个瓶颈,即使是边界处的简单随机扰动也可以恢复有意义的性能增益。基于这一发现,我们提出了近边界随机救援(NSR),这是一种最小的即插即用修改,可以随机保留这些稍微出界的词元以恢复丢失的信号。虽然 NSR 通过随机采样可以解释为在期望中引发隐式梯度衰减,但我们的消融表明其随机的边界局部救援机制始终比确定性梯度衰减更有效。经过从 7B 到 30B 的模型大小以及密集架构和 MoE 架构的大量实验的验证,作为即插即用的解决方案,NSR 显着提高了训练稳定性,并在 DAPO 和 GSPO 等强大基线上提供了一致的增益。