论文
让稀疏奖励发挥作用:多奖励强化学习的密度感知奖励聚合
Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL
摘要
多奖励强化学习训练大语言模型以同时满足多个行为目标。 GDPO 中使用的奖励明智标准化保留了部署组内特定于奖励的相关信息,但不同的目标仍然可能表现出不均匀的学习进度。我们通过优势能量(即奖励相对于批次的优势平方之和)来研究这种行为。在理想化的 GDPO 标准化下,我们表明这种能量与活跃组密度成正比:奖励提供非零相对优势的rollout组的比例。这揭示了残留的批次级信号不平衡,并为校准奖励贡献提供了基础。基于这种关系,我们提出了密度感知奖励聚合(DARA)。我们推导了一种反平方根密度校正,该校正对来自不太频繁的活跃奖励的信号赋予更大的权重。 DARA 计算每个rollout批次的权重,适应整个训练过程中奖励活动的变化,而无需修改底层策略优化目标。工具调用和数学推理实验表明,DARA 比 GDPO 更快地学习目标行为,在工具调用方面减少了 26% 的训练步骤,达到了高格式合规性;在数学推理方面,减少了 65% 的步骤,达到了接近饱和的长度合规性,同时在最终性能上保持了竞争力。我们的代码可在 https://github.com/zhaihaotian/DARA. 获取