论文

EGAD:用于 词元级 知识转移的熵引导自适应 蒸馏

EGAD: Entropy-Guided Adaptive Distillation for Token-Level Knowledge Transfer

摘要

大语言模型 (LLM) 在不同领域取得了卓越的性能,但其巨大的计算和内存需求阻碍了在资源有限的环境中的部署。 知识蒸馏 通过将知识从大型教师模型转移到较小的学生模型,提供了一种有前景的解决方案。然而,现有的 蒸馏 方法通常平等地对待所有标记,忽略了不同标记对模型决策的贡献不同的事实。这可能导致知识转移效率低下并降低学习效率。为了解决这个限制,我们提出了一种基于熵的自适应 蒸馏 策略,该策略动态调整 词元级 的训练过程。我们的方法利用教师的输出熵来指导 蒸馏 的三个方面。具体来说,我们通过在训练期间动态地将焦点从低熵标记转移到高熵标记来引入 词元级 课程。我们根据词元熵进一步调整 蒸馏 温度,以更好地捕获教师信心模式。此外,我们采用双分支架构,在简单词元上实现高效的仅 logits 蒸馏,在困难词元上实现基于更深入特征的 蒸馏。大量的实验验证了我们方法的合理性和有效性。