论文

面向语言模型知识蒸馏的教学法启发数据合成

Pedagogically-Inspired Data Synthesis for Language Model Knowledge Distillation

模型训练合成数据

摘要

从大型语言模型(LLM)向更小模型的知识蒸馏已成为部署高效AI系统的关键技术。然而,当前经由合成数据进行的蒸馏方法缺乏教学法意识,把知识转移当作一次性的数据合成与训练任务,而非系统的学习过程。本文提出一个借鉴基本教育原则的LLM知识蒸馏新框架。我们的方法引入三阶段流水线——知识识别器(Knowledge Identifier)、组织者(Organizer)与适配器(Adapter)(IOA)——系统地识别学生模型的知识缺陷,通过渐进式课程组织知识传递,并调整表征以匹配学生模型的认知能力。我们整合Bloom精通学习原则与Vygotsky最近发展区,构建动态蒸馏过程:学生模型在先修知识上接近教师模型表现后才进阶,新知识以受控、渐进的难度增量引入。以LLaMA-3.1/3.2和Qwen2.5为学生模型的大量实验表明,IOA相比基线蒸馏方法取得显著改进,学生模型在DollyEval上保留教师模型94.7%的性能,而参数量不足十分之一。我们的框架在复杂推理任务上尤为出色,相比最先进基线在MATH上提升19.2%,在HumanEval上提升22.3%。

面向语言模型知识蒸馏的教学法启发数据合成
图5:对我们 IOA 框架中 Identifier 组件的另外五个关键超参数 τ gap \tau_{\text{gap}} 、 τ high \tau_{\text{high}} 、 τ low \tau_{\text{low}} 、 τ dep \tau_{\text{dep}} 、 α \alpha 的超参数鲁棒性分析。