论文
MDP-GRPO:多约束指令跟随的稳定组相对策略优化
MDP-GRPO: Stabilized Group Relative Policy Optimization for Multi-Constraint Instruction Following
摘要
具有可验证奖励的强化学习是多约束指令遵循的理想选择,但标准的组相对策略优化(GRPO)在离散、低分散奖励下变得不稳定,其中组内奖励分布通常是同质的。我们识别并形式化了这种情况下 z 分数组标准化的三种病理:低方差放大、均值中心盲目性和零方差崩溃。为了解决这些问题,我们提出了 MDP-GRPO,它通过(1)多温度采样来增加奖励分散,(2)双锚优势来恢复同质组中的梯度并阻止均值中心盲目性,(3)基于 Kahneman 和 Tversky 理论的前景理论整形来限制更新并惩罚违规行为,以及(4)非对称 KL 正则化来稳定学习。在 FollowBench、IFEval 和精选的多约束数据集上进行评估,MDP-GRPO 的性能优于标准 GRPO,在 Llama-3.2-3B 上将严格约束满意度提高了高达 5.0%。我们的方法还能够实现小群体规模的稳定收敛,同时保留 MMLU 和 ARC 的一般功能。