论文
不需要强老师吗?关于LLM预训练中的蒸馏
Strong Teacher Not Needed? On Distillation in LLM Pretraining
摘要
知识蒸馏 通常假设一种强弱关系,即更强的教师会产生更好的学生。在这项工作中,我们在 大语言模型 预训练中检查了关于 蒸馏 的假设。通过改变架构大小和训练 词元预算,我们创建了强到弱、同级、弱到强的师生关系,并研究了 蒸馏 在每种关系下的有效性。我们发现教师不必很强:通过适当混合语言建模和 知识蒸馏 损失,即使是规模较小且训练有素的教师也能提高较大的学生。与此同时,更强的教师并不总是更好:通过更多参数或更多训练词元进一步推动教师,可以使 蒸馏 增益饱和甚至逆转。我们进一步观察到 蒸馏 比域内拟合更容易提高泛化能力(分布外和下游性能)。这些结果共同挑战了“蒸馏 预训练始终需要一位强大的老师”这一普遍信念。