论文

UniSD:为 大语言模型 建立统一的自我 蒸馏 框架

UniSD: Towards a Unified Self-Distillation Framework for Large Language Models

摘要

Self-蒸馏 (SD) 为适应 大语言模型 (LLM) 提供了一条有希望的途径,而无需依赖更强大的外部教师。然而,自回归 LLM 中的 SD 仍然具有挑战性,因为自生成轨迹是自由形式的,正确性取决于任务,并且合理的基本原理仍然可以提供不稳定或不可靠的监督。现有的方法主要检查孤立的设计选择,而其有效性、作用和相互作用则不清楚。在本文中,我们提出了 UniSD,一个系统地研究自我 蒸馏 的统一框架。 UniSD 集成了解决监督可靠性、表示对齐和训练稳定性的补充机制,包括多教师协议、EMA 教师稳定性、词元级 对比学习、特征匹配和分歧裁剪。通过六个基准测试和三个模型系列的六个模型,UniSD 揭示了自我 蒸馏 何时比静态模仿有所改进、哪些组件驱动了增益,以及这些组件如何跨任务交互。在这些见解的指导下,我们构建了 UniSDfull,这是一个集成管道,它结合了互补组件并实现了最强的整体性能,比基本模型提高了 5.4 点,最强基线提高了 2.8 点。广泛的评估强调自我 蒸馏 作为一种实用且可指导的方法,可以在没有更强大的外部教师的情况下实现高效的 LLM 适应。