论文
重新思考 LLM RL 中的散度正则化
Rethinking the Divergence Regularization in LLM RL
摘要
强化学习(RL)已成为后训练 大语言模型(LLM)的关键组成部分。在实践中,由于训练推理不匹配和策略陈旧,LLM RL 通常是 离策略,这使得信任区域控制对于稳定优化至关重要。 PPO 和 GRPO 等主流方法通过比率裁剪机制来近似这种控制,但重要性比率不能很好地代表长尾词汇表的分布变化。最近的工作(例如 DPPO)通过用基于散度的掩码替换基于比率的裁剪来解决这种不匹配问题,从而产生由采样词元的绝对概率偏移定义的信任区域。然而,DPPO 仍然依赖于硬掩模:一旦词元以有害方向跨越信任区域边界,其梯度就会被丢弃而不是被纠正。为了解决这个问题,我们提出了发散正则化策略优化(DRPO),它用平滑的优势加权二次正则化器 同策略 移位代替硬掩模。 DRPO 保留了与 DPPO 相同的信任区域几何形状,同时引入有界的、连续的梯度权重,以减弱发散的更新并提供超出边界的校正信号。跨模型规模、架构和精度设置的实验表明,DRPO 提高了 LLM RL 训练的稳定性和效率。