论文

不要让收益消失:打破强化学习中的政策梯度权重

Don't Let Gains FADE: Breaking Down Policy Gradient Weights in RL

模型训练强化学习

摘要

强化学习 后训练 极大地提高了 LLM 推理能力,但存在训练不稳定和多样性崩溃的问题。优势函数提供了一个有吸引力的解决方案:它们重塑了训练目标,重新衡量了哪些执行轨迹可以驱动学习,并且实施起来很简单。然而,方法的激增使得人们不清楚何时使用哪种优势。我们通过一个统一的框架来消除混乱,该框架将任何优势分解为沿两个正交轴的正梯度质量和负梯度质量。在符号轴上,不平衡的更新会破坏熵或权重几何结构。在难度轴上,聚焦难题会增强信号,但会消耗样本量。这两种权衡在训练过程中都会发生变化:探索有利于平衡和集中注意力;剥削有利于压制和中等焦点。这激发了 FADE(具有动态熵的焦点优势),这是一种自适应优势,可以读取训练动态来自动安排梯度权重。 FADE 在 7B 规模上比最佳静态基线早 20k 步达到峰值 pass@1,在 32B 上早 2k 步,同时在 LiveCodeBench 和 AIME 上的所有 pass@k 上实现最佳准确性与多样性权衡。