论文

了解剩下的,而不是掌握的:饱和感知优势重新加权以实现多奖励策略优化

Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization

模型训练强化学习

摘要

具有群体相对优势的强化学习(RL)已成为后训练语言模型推理机的事实上的标准。然而,当优化多个奖励目标时,现有方法通常在分组标准化之前使用固定的加权和来缩放奖励向量。我们表明,这种设计会导致两个基本问题:具有不同奖励配置的采样轨迹可以获得相同的优势,并且所有目标都以固定的相对权重进行优化,无论其当前的饱和水平如何。因此,训练继续将梯度预算分配给已经解决的目标,而不是关注那些剩余空间更大的目标。我们引入了\textbf{多奖励策略优化的饱和感知优势重新加权}(SA-MRPO),它独立地标准化每个奖励目标,并根据目标饱和度的批量估计自适应地折扣其贡献。这会动态地将优化工作重新分配给未优化的目标,同时根据经验维持那些已经非常满意的目标的性能。我们进一步表明,饱和感知重新加权可以反转更新的符号,而不仅仅是重新调整其幅度。在使用两个和三个目标奖励组合的数学推理中,SA-MRPO 在 15 个基准比较中的 12 个中比 GDPO 提高了更难的正确性目标,在 AIME24 上的收益高达 $5\%$。在自适应推理方面,它提高了所有五个基准测试的准确性,平均提高了 3.8\%$,在 AMC23 上最高提高了 9.2\%$;在编码基准测试中,它提高了通过率高达 $2.3\%$,同时在所有设置中保持较容易的目标接近其已经满意的水平。