论文
分数中心稳定离策略强化学习
Score Centering Stabilizes Off-policy Reinforcement Learning
摘要
众所周知,大型语言模型的强化学习 (RL) 对训练和推理引擎之间的微小差异非常敏感,通常称为训练-推理不匹配 (TIM)。然而,完全消除 TIM 是不切实际的,因为这会降低部署效率。在本文中,我们表明 TIM 下 RL 的不稳定性主要是由漂移引起的:训练和推理引擎之间的持续偏差随着每个训练步骤而累积。我们推导出一个附加的“分数居中”校正项,通过消除漂移来稳定 TIM 下的 RL。当训练从 0.6B 到 30B 参数的模型时,单独的分数中心匹配或优于基于量化下重要性采样的方法,并且随着不匹配变得更加严重,差距越来越大。因为校正是相加的,所以分数居中也与重要性采样相结合——在我们的陈旧性实验中,它们的组合优于纯粹的重要性采样基线。