论文
了解 后训练 中的 知识蒸馏:何时有用、何时失败
Understanding Knowledge Distillation in Post-Training: When It Helps and When It Fails
摘要
大语言模型 (LLM) 在许多任务中实现了强大的性能,但其高计算成本限制了在资源受限环境中的部署。 知识蒸馏 (KD) 提供了一种实用的解决方案,将知识从较大尺寸的教师模型转移到较小的学生模型。虽然之前的工作主要检查特定任务或小规模设置,但用于构建通用指令跟踪模型的 后训练 阶段受到的关注有限。在本文中,我们使用大规模 Tulu 3 数据集对 后训练 中的 KD 进行了系统研究。我们发现 KD 在低数据情况下优于有监督的 微调 (SFT),但随着更多训练数据的添加,其优势逐渐减弱。即使有丰富的数据,从更强大的指导调整教师中提取也能恢复实质性收益,这表明当教师提供学生无法仅从训练数据中轻松获取的知识时,KD 仍然有效。我们进一步研究特定领域的低资源场景,并提出了一种两阶段 KD 策略,该策略利用合成的教师标记数据,然后对人工注释进行细化。这种方法持续提高学生的表现,为在数据稀缺环境中构建紧凑模型提供实用指导。