论文
SoftmaxGRPO:使用 Softmax 优势组估计学习推理
SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation
摘要
基于小组的强化学习目标(例如 GRPO)可能会在提示难度上分配学习信号很差:在二元奖励下,小组标准化会导致简单提示的权重不同。我们引入了 Softmax Advantage Group Estimation (SoftmaxGRPO),这是一种替代方案,用温度缩放的 Softmax 优势取代 z 分数归一化的群体优势,无论提示难度如何,都保持权重有界。对于二元奖励,我们推导出精确的有限群种群目标,并将 MaxRL 确定为其低温限制。对于有界标量奖励,我们表明大组更新精确地优化了对数矩生成函数目标,而如果没有对奖励分布的额外假设,通用有限组标量目标就不可能存在。根据经验,SoftmaxGRPO 重新分配测量的梯度预算,远离接近解决的提示,并在相同奖励下持续改进 GRPO。它在具有可验证奖励的 DeepMath 上达到 51.8%,并且仅使用轻量级文本相似性奖励将 Poetry 上的 1.5B 指令调整模型从 35.0% 改进到 68.0%。