论文

使用 同策略 反向 蒸馏 引发从弱到强的泛化

Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation

摘要

弱到强泛化询问更强的模型是否可以向较弱的监督者学习并超越他们。这个问题对于连续的模型生成和多域整合尤其重要,因为从头开始重复前沿规模的 后训练 可能会非常昂贵。然而,传统的蒸馏将弱教师视为优化目标,可能将其能力上限强加给学生。我们引入了 同策略 反向 蒸馏 (OPRD),它评估教师相对于其对学生采样轨迹的参考策略的策略转变,并沿该方向放大学生验证者驱动的策略梯度的组成部分。通过仅重新调整验证者支持的更新,OPRD 保留了策略优化的驻点,同时加速了超越教师的学习。在连续模型迁移和多教师 蒸馏 中,OPRD 比现有的 RL 和 蒸馏 方法以更少的学生更新实现了更高的性能。响应式分析表明,OPRD 学生仍然更接近于仅使用基于验证者的 RL 训练的模型,而不是较弱的教师,这表明教师的指导会加速而不是重定向学生自己的优化。传统从强到弱的 蒸馏 的结果进一步表明,无论容量排序如何,OPRD 都有效地将验证者驱动的策略优化与教师指导结合起来。