论文

强化学习先于强化学习:关于更好的强化学习的策略蒸馏

RL Starts before RL: On Policy Distillation for Better Reinforcement Learning

摘要

强化学习 (RL) 可以提高推理能力,但其性能取决于训练开始的策略。我们研究了策略蒸馏(OPD)作为强化学习的准备阶段,并询问它的好处是否超出了蒸馏模型初始精度的提高。在共享强化学习设置下,使用 OPD 初始化的学生比使用直接强化学习或监督微调和强化学习训练的学生达到更高的最终表现。即使 OPD 几乎无法立即提高准确性,这种优势也会显现出来。 Pre-RL Pass@k 并没有完全解释其好处:相似甚至更高的值并不一定会在 RL 之后带来更好的性能。行为分析指出,一种可能的解释是,与教师的分布保持一致,超出了第一名的一致性。这种对齐可能有利于更高质量的推理路径,同时保留 RL 可以使用结果反馈进一步细化的替代方案。我们进一步研究轨迹源和发散目标如何影响后续强化学习的蒸馏价值。标准反向 KL OPD 在 RL 之前表现更好,但正向 KL OPD 之后超过它;凭借教师生成的蒸馏轨迹,反向 KL 在两个阶段都保持领先。这些发现表明,首选的蒸馏目标取决于轨迹源和随后的训练。我们的结果支持评估 OPD 作为 RL 的准备,并根据后续训练后实现的性能来选择蒸馏选择。