论文

当 RL 在 SFT 之后失败时:恢复模型可塑性以实现稳健的 SFT 到 RL 切换

When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff

模型优化模型合并

摘要

监督式 微调 (SFT) 和强化学习 (RL) 已成为 大语言模型 (LLM) 后训练 的标准流程。 SFT 有望为 RL 提供有用的行为先验,以进一步增强模型能力。然而,SFT 过多的检查点在强化学习期间通常表现出有限的改进。我们将这种失败归因于模型可塑性的丧失:SFT 初始化的策略被后续 RL 有效重塑的能力降低。为了更好地理解这一现象,我们从多个角度进行详细分析,包括参数变化、输出空间和强化学习优化动态。我们的结果表明,过度 SFT 的模型往往会产生过度自信的词元分布并表现出尖锐的参数景观,这使得它们在 RL 阶段更难以优化。为了实现更稳健的 SFT 到 RL 切换,我们提出了 \texttt{Rejuvenation},这是一种简单而有效的方法,可以恢复可塑性,同时保留有用的 SFT 获得的先验。 Rejuvenation 利用基础锚定模型融合来减少 SFT 引起的过度漂移,并通过目标神经元重置来减轻模型刚性。数学推理任务和代理任务的实验结果表明,我们的方法持续提高了过度训练的 SFT 模型的 RL 性能,同时还增强了对分布外任务的泛化。