论文
为什么按策略蒸馏有时会失败:学习信号消失
Why On-Policy Distillation Sometimes Fails: Vanishing Learning Signals
摘要
在策略蒸馏(OPD)可以实现语言模型之间的有效能力转移,但其失败的机制尚不完全清楚。在代码生成和数学推理方面,大规模教师的 OPD 表现出早期损失平台,200 次更新后平均最终损失减少了 25.1%,而自 RL 教师通过对初始学生的进一步强化学习 (RL) 训练获得了 96.2% 的损失。为了理解这种差异,我们将 OPD 分析为小学习率限制下的理想化连续时间动态系统。我们的训练日志诊断将这些平台与基于梯度的学习信号代理的早期下降联系起来,同时仍然存在大量损失;这些测量结果并不能确定潜在梯度减弱的原因。我们进一步证明了在正则条件下共享参数化中教师与初始学生足够接近的局部恢复保证,为我们实验中自我强化学习教师的成功提供了有条件的解释。跨越有损失和无损失的运行 在平稳期,我们观察到较小的相对参数变化(0.025-0.098%)以及 OPD 前后学生表征之间的高度相似性(跨层线性 CKA $>0.98$)。这些观察结果表明,有限的表征适应可能会导致学习信号崩溃,这一假设仍有待检验。代码可在 https://github.com/leizhao7/opd-learning-signals. 获取