论文
CorrGRPO:用于多奖励学习的相关归一化 GRPO
CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning
摘要
组相对策略优化 (GRPO) 广泛用于训练推理语言模型,它通过在同一提示的rollout中集中和规范化奖励来计算优势。对于多种奖励,GRPO 将奖励成分相加,并通过其组内标准差对总奖励进行标准化。相应的方差等于所有成对奖励协方差的总和。对于固定中心奖励,较大的总协方差产生较小的优势,反之亦然,允许更新幅度适应奖励依赖性。然而,大规模的相关奖励可以主导这种标准化,并抑制来自较小规模奖励的信号。我们提出相关归一化 GRPO (CorrGRPO),它将成对协方差归一化为皮尔逊相关系数。 CorrGRPO 保持中心总奖励不变,同时平衡不同尺度奖励对基于相关性的标准化的影响。这使得优势幅度能够适应奖励相关性,而无需由大规模奖励成分主导标准化。我们使用 0.5B 到 8B 参数范围的模型,将 CorrGRPO 与 GRPO 以及其他变体在代码生成、工具调用和Agent安全性方面进行比较。这些任务都涉及多种奖励,可以一起改进或进行权衡。结果显示了三个领域的改进,包括代码生成、工具调用和Agent安全性。我们的代码可在 https://github.com/HKUST-KnowComp/CorrGRPO. 获取