论文
课程学习引导渐进式 蒸馏 in 大语言模型
Curriculum Learning-Guided Progressive Distillation in Large Language Models
摘要
知识蒸馏 是将 大语言模型 (LLM) 的功能转移到更小、更高效的学生模型中的关键技术。现有的 蒸馏 方法常常忽略两个关键因素:训练数据的学习顺序以及教师和学生模型之间的能力不匹配。这种疏忽限制了 蒸馏 的表现,正如更优秀的教师无法培养出更好的学生的反直觉现象所表明的那样。在这项工作中,我们提出了课程学习引导渐进式 蒸馏 (CLPD),这是一个统一的框架,通过将数据难度与教师实力相结合来明确考虑这两个因素。 CLPD 通过从易到难的方式组织训练实例来构建显性课程,同时通过逐步安排能力不断增强的教师,将隐性课程应用于监督信号。我们的框架是模块化的,可以以最小的开销集成到标准 蒸馏 算法中。推理基准的实证结果表明,CLPD 在多种设置中始终优于标准 蒸馏、单独数据排序和单独教师调度。这些发现强调了在将推理能力提炼成小语言模型时共同考虑数据排序和教师能力的重要性。