论文

重新思考多教师模型能力合并的自蒸馏

Rethinking Self-Distillation for Multi-Teacher Capability Merging

摘要

从同一基础检查点开始训练的多个专家模型的组合能力在前沿语言模型后训练中变得越来越常见。最近的趋势表明,多教师模型 在策略蒸馏 (MOPD) 优于传统的 off-策略方法。然而,尽管 MOPD 带来了更高的推理和环境交互成本,但我们发现其报告的精度增益大部分是由于某些训练设计选择和超参数优化,而不是算法本身。我们在两个多教师模型设置、四个模型和 11 个基准上进行了受控自蒸馏研究,比较了非策略方法,即监督微调 (SFT) 和软标签蒸馏,与混合教师模型前缀蒸馏和 MOPD。我们发现所有四种方法都达到了 \textit{几乎相同} 的准确性。但是,MOPD 使用 $14.8$--$23.1\times$ SFT 的训练 GPU 小时。我们还重新审视了最近发布的四项 在策略和 off-策略蒸馏之间的比较,发现当 SFT 基线在拒绝采样的教师模型轨迹上进行训练并使用独立调整的超参数时,报告的 在策略增益大幅缩小。作为无需训练的替代方案,我们还发现简单的权重合并方法可以在几分钟的 CPU 合并时间内恢复专家能力,尽管它们的准确性会随着模型大小的减小和任务干扰的增加而降低。总体而言,我们的结果对最近报告的 MOPD 收益提出质疑,并建议仔细调整更有效的非策略基线作为可行的替代方案。