论文

发现并缓解多奖励强化学习中聚合引发的 奖励作弊

Uncovering and Mitigating Aggregation-Induced Reward Hacking in Multi-Reward Reinforcement Learning

模型训练强化学习

摘要

大语言模型的强化学习微调越来越多地采用多种奖励维度,包括可验证规则、特定任务评估器和学习奖励模型,以提供跨不同能力的更丰富的监督。这些维度通常使用固定的聚合权重进行标量化。我们确定了一种故障模式,其中聚合本身会导致 奖励作弊:静态投影将性质不同的奖励配置文件别名为单个标量,将优化转向奖励信号最简单、最密集或系统地青睐的维度。经过训练,这会使策略陷入次优状态,并阻止收敛到更平衡的策略,从而产生更高的任务性能。为了解决这个问题,我们提出了自适应多奖励投影(AMRP),这是一种轻量级在线方法,它使用三个信号(相对短缺、奖励波动性和近期进展)重新分配聚合权重,增加对滞后、不稳定或停滞维度的压力,同时缓解饱和维度。在 GRPO 下的结构化推理、基于引文的生成和开放式对齐中,AMRP 在固定和动态加权基线上持续改善奖励配置平衡和下游绩效;它还对 GDPO 和 PPO 保持有效,支持跨 RL 算法的兼容性。我们的代码可在 https://github.com/yyhappier/AMRP.git 获取。