论文
Self-蒸馏作为LLM的性能恢复机制:抵消压缩和灾难性遗忘
Self-Distillation as a Performance Recovery Mechanism for LLMs: Counteracting Compression and Catastrophic Forgetting
摘要
大语言模型(LLM)取得了令人瞩目的成功,支撑了多样化的人工智能应用。然而,由于监督 微调 (SFT)、量化和剪枝期间的灾难性遗忘等因素,它们经常遭受性能下降。在这项工作中,我们介绍了一种基于Self-蒸馏 微调(SDFT)的性能恢复框架,可以有效地恢复模型能力。作为对这一实际贡献的补充,我们为底层恢复机制提供了严格的理论解释。我们假设 LLM 的生成能力从根本上依赖于其隐藏层构造的高维流形。为了研究这一点,我们采用中心核对齐(CKA)来量化学生和教师激活轨迹之间的对齐,利用其正交变换和缩放的不变性。我们的实验证明了表现恢复和流形对齐之间存在很强的相关性,证实了自我 蒸馏 有效地将学生的高维流形与教师代表的最佳结构对齐的说法。这项研究弥合了实际恢复框架和几何表示理论之间的差距,为自我 蒸馏 的内部机制提供了新的见解。