论文

SMOPD:通过专业化和合并在线策略进行多奖励强化学习 蒸馏

SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation

摘要

我们的目标是提高多奖励强化学习训练过程中的模型性能。现有的群体奖励解耦标准化策略优化(GDPO)通过在聚合之前单独标准化每个奖励维度,缓解了直接缩放期间奖励信号相互掩盖的问题。然而,我们的实验表明 GDPO 仍然难以平衡不同粒度的奖励信号。具体来说,在某些特定的训练任务中,模型可能会收到密集奖励,分配从 0.1 到 1.0 的细粒度分数,以及稀疏奖励,仅提供 0 或 1 的二进制反馈。在这种情况下,我们发现稀疏奖励可能提供不充分的优化信号,从而阻止其相应的能力得到有效增强。因此,我们如何在不牺牲从细粒度奖励中已经学到的能力的情况下增强稀疏奖励的优化信号?为了克服这一限制,我们提出了专门化和合并在线策略 蒸馏 (SMOPD),这是一种用于多奖励优化的两阶段训练方法。 Stage1-Specialize:SMOPD首先采用奖励优先配置来训练多个奖励专业教师,让每个奖励在其信号可以有效驱动优化的条件下进行学习。 Stage2-Merge:SMOPD 然后利用在线策略 蒸馏 将这些教师的奖励专业能力结合到单个学生策略中,同时保持平衡的任务级别优化。为了验证我们的方法,我们对两种多重奖励设置进行了实验:互补奖励(工具调用的准确性和格式)和冲突奖励(有用和无害的奖励)。基于上述设置,SMOPD 在 1.5B、3B 和 7B 主干上的性能优于 GDPO。