论文
解开自蒸馏:测量和建模采集和保留
Disentangling Self-Distillation: Measuring and Modeling Acquisition and Retention
摘要
具有特权上下文的自蒸馏通过让模型在以参考响应为条件后,通过标记来教授其与上下文无关的复制标记,从而适应来自演示的语言模型。我们的分类法揭示了现有方法在三个纠缠轴上有所不同:(i)rollout源(学生或教师),(ii)教师耦合(冻结,或学生在某种耦合率下的指数移动平均值)和(iii)KL方向(反向或正向),但这些轴通常以固定组合进行研究,并导致了相互矛盾的结论。我们形式化了一个统一的框架,涵盖所有自蒸馏方法与经典的监督微调:我们在 Qwen2.5-7B 和 Ministral-3-3B 上跨普通和矛盾的任务训练三个轴的每种组合,总共 1,200 次适应运行,以系统地研究上述轴的影响。我们提出了同一目标的受控模型来解释由此产生的获取-保留权衡。我们发现(i)在任务与预先训练的行为相矛盾的情况下,rollout来源最重要:教师的rollout使习得远远高于学生的rollout,而保留率几乎没有变化; (ii) 在每项任务中,教师耦合对习得的影响最大:习得随着耦合率的上升而上升,然后下降到超过特定于任务的速率; (iii) 切换 KL 方向需要在一个模型中保留,但在另一个模型中则不然,因此首先调整哪个轴取决于模型。受控模型再现了这三种趋势。