论文

GD$^2$PO:通过群体动态奖励解耦策略优化缓解多奖励冲突

GD$^2$PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization

模型训练强化学习

摘要

随着LLM的不断进步,后训练强化学习(RL)越来越依赖多维度奖励来培养综合能力。这种转变需要能够同时优化不同且潜在竞争目标的新算法。为了解决这个问题,现有的方法,例如组奖励解耦策略优化(GDPO),将总体得分分解为独立的奖励组,然后分别计算每个组内的 RL 损失。然而,这种策略仍然会遇到多奖励冲突:单条采样轨迹可以在某些奖励维度上产生积极的优势,但在其他奖励维度上产生消极的优势,导致相反的信号在聚合过程中相互抵消,进一步阻碍强化学习的训练效率。受动态采样策略优化(DAPO)的启发,DAPO 通过过滤掉优势接近于零的无效采样轨迹来提高 RL 训练效率,我们提出了群体动态奖励解耦策略优化(GD$^2$PO)。具体来说,GD$^2$PO 采用冲突感知过滤机制来掩盖因严重的奖励分歧而导致的采样轨迹。通过防止冲突信号相互抵消,这种屏蔽策略保留并增强了有效 RL 优势的程度,从而显着提高了学习效率。此外,我们引入了查询级别重新加权,以根据其整体奖励共识动态调整每个查询的更新强度。对各种多重奖励场景(包括工具调用和人类偏好调整)的实验表明,GD$^2$PO 始终且显着优于现有基线。该代码可在 https://github.com/Qwen-Applications/GD2PO 获取。