论文

通过直接 同策略 蒸馏 进行弱到强泛化

Weak-to-Strong Generalization via Direct On-Policy Distillation

模型训练强化学习

摘要

具有可验证奖励的强化学习 (RLVR) 是改进语言模型推理的有效方法,但在每个新的强模型上重复的成本很高,因为目标模型必须在训练期间生成多次展示。随着模型规模的扩大,后训练 本身就成为了瓶颈。我们研究了一种从弱到强的替代方案:在较小的模型上运行强化学习,其中轨迹采样成本更低,然后重用强化学习运行学到的知识来改进更强的目标模型。直接提取 RL 后的弱教师是不够的,因为教师的最终策略将有用的 RL 收益与较小模型的局限性混合在一起。我们提出 Direct 同策略 蒸馏 (Direct-OPD),它转移了教师的 RL 诱导的政策转变。 Direct-OPD 将 RL 后的教师与其自己的 RL 前的参考进行比较,并将它们的对数比视为对学生的密集隐式奖励。简单来说,检查点对告诉我们 RL 使弱模型更有可能采取哪些行动,而 Direct-OPD 将该信号应用于较强学生自己的 同策略 状态。这直接重用了弱模型的 RL 监督信号,而无需在目标模型上运行稀疏奖励 RL。根据经验,Direct-OPD 始终利用较弱的教师来改进更强的目标模型;值得注意的是,它在 8 个 A100 GPU 上仅用了 4 小时就将 Qwen3-1.7B 在 AIME 2024 上的性能从 48.3% 提升到了 58.3%。它的性能优于步长匹配的直接强化学习,并支持多个策略转变的顺序组合。我们的结果表明,强化学习的结果可以在模型尺度上作为隐式奖励信号重复使用,而不仅仅是作为最终的模型来模仿。