论文
LLM 后训练 的精炼强化学习
Distilled Reinforcement Learning for LLM Post-training
摘要
大语言模型 (LLM) 后训练 对于提高推理、适应和对齐至关重要。现有方法主要遵循两种范式:强化学习(RL)和同策略 蒸馏(OPD)。然而,强化学习依赖于粗粒度的结果监督,导致信用分配困难且获取新知识的能力有限。与此同时,OPD通过KL散度无条件地匹配教师logits,这就造成了一个困境:相似的教师提供的新知识很少,而实质上不同的教师往往产生无效的指导,很大程度上将OPD限制在家庭内部的蒸馏。我们提出了蒸馏强化学习(Distilled RL),它将教师监督融入到 RL 目标中,以提供细粒度的指导,有选择地转移新知识并避免无条件模仿。精炼强化学习包含三个组成部分:带裁剪的反向重要性采样、负样本重置和序列级几何归一化。通过简洁且可解释的案例研究,我们证明了蒸馏强化学习可以有效地将以前无法获得的知识从教师模型转移到学生模型。跨家庭内和跨家庭 蒸馏 设置的大量实验表明,蒸馏 RL 在 pass@1 和 pass@k 方面均明显优于标准 RL 和 OPD。我们的代码位于 https://github.com/597358816/Distilled-RL。