论文

重新思考逆向 KL 作为自适应熵 蒸馏

Rethinking Reverse KL as Adaptive Entropy Distillation

摘要

知识蒸馏 (KD) 被广泛用于将 大语言模型 (LLM) 的功能转移给较小的学生,但现有的目标往往难以平衡忠实的模仿和稳健的生成。特别是,现有方法主要将FKL和RKL结合起来,忽略了RKL本身提供了一种调整学生模仿强度的机制。受此启发,我们重新审视 同策略 逆向 Kullback-Leibler (RKL) 蒸馏 并将其目标分解为教师拟合项和学生熵项,而不引入显式的 FKL 分支。我们从理论上证明,词元级 最优学生分布对应于教师分布的缓和变体,其中自适应权重控制模式搜索和不确定性保留之间的权衡。在这一见解的指导下,我们提出了 \textbf{自适应熵 蒸馏 (AED)},它使用教师的熵来动态校准 词元级 模仿强度。指令遵循和数学推理基准实验表明,AED 实现了卓越的整体性能,并且总体上改善了师生分布和熵对齐。