论文
通过交互将 知识蒸馏 解释为 大语言模型 的统一方法
A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions
摘要
尽管知识蒸馏(KD)在大语言模型(LLM)中取得了成功,但其功效背后的潜在机制仍不清楚。在本文中,我们提出了一种统一的方法来探索使用交互的各种 KD 方法的共同机制。具体来说,我们将 LLM 的输出分数分解为众多交互的总和。每个交互都代表涉及一组输入变量(例如单词)的非线性关系。基于分解的交互,我们发现各种 KD 方法背后的共同机制是交互的稀疏化,即学生模型保留较少的交互用于推理,同时将其他交互抑制到零效果。此外,我们发现不同 KD 方法之间的性能差异源于它们处理复杂交互的能力。如果 KD 方法使学生模型能够实现复杂交互的更高稀疏性,那么它通常会产生更好的性能。受这些见解的启发,我们提出了一种称为复杂交互惩罚(CIP)的即插即用损失函数,以在 蒸馏 过程中明确强制复杂交互的稀疏性。大量实验表明,集成 CIP 可以持续提高多种 KD 方法在域内和分布外基准测试上的性能。