论文
论在on-policy蒸馏中的离政策教师
On the Off-Policy Teacher in On-Policy Distillation
摘要
在on-policy蒸馏(OPD)最近成为一种有前途的训练后范例,其中学生在教师的密集监督下从自己的政策生成的轨迹中学习。然而,OPD 引入了一个基本的不对称性:虽然采样轨迹对于学生来说是在策略内的,但对于教师来说却是离策略的。教师通常经过优化,可以继续使用其自己的策略生成的前缀,但在 OPD 期间,它必须改为监督学生生成的前缀。根据经验,我们发现随着这些前缀变长,它的延续性能会下降。为了解决这个问题,我们提出了教师的学生条件更新(SCOUT),这是一个协同训练框架,可以使教师适应学生生成的前缀。除了标准 OPD 更新之外,SCOUT 使用具有可验证奖励的强化学习定期优化教师的条件能力,其中教师从学生前缀中生成延续并从结果奖励中学习。对照实验表明,SCOUT 提高了教师从学生生成的前缀继续进行的能力,支持学生条件下的教师适应的预期机制。在多个师生配置、模型规模和推理领域中,SCOUT 还持续提高了策略蒸馏的有效性。