论文
跟随教师的足迹:面向领域专用 LLM 的调度检查点蒸馏
Following the Teacher's Footsteps: Scheduled Checkpoint Distillation for Domain-Specific LLMs
摘要
大语言模型(LLM)因其庞大规模而在领域特定任务的部署上颇具挑战。将微调后的 LLM 蒸馏到更小的学生模型是有前景的替代方案,但师生之间的容量差距常导致性能欠佳。这引出一个关键问题:学生模型何时以及如何才能在领域特定任务上追平甚至超越其教师?本工作提出一个新的理论洞见:如果学生在学生偏好子域(Student-Favored Subdomain, SFS)上的优势超过其在教师偏好子域(Teacher-Favored Subdomain, TFS)上的劣势,学生便能超越教师。基于这一洞见,我们提出调度检查点蒸馏(Scheduled Checkpoint Distillation, SCD),通过在领域任务的监督微调(SFT)过程中模拟教师的收敛过程来缩小 TFS 劣势,并提出样本级的自适应加权(AW)机制以保留学生在 SFS 上的优势。在多种领域任务——包括多语言问答、命名实体识别与文本分类——上的实验表明,我们的方法持续优于现有蒸馏方法,使学生模型能够追平甚至超过其微调教师的表现。
