论文
重新思考 大语言模型 蒸馏 中温度的作用
Rethinking the Role of Temperature in Large Language Model Distillation
摘要
在 大语言模型 (LLM) 蒸馏 中,反向 Kullback-Leibler (RKL) 散度比正向 KL (FKL) 更受欢迎,但这种偏好很大程度上是基于忽略温度 $τ$ 的比较,忽视了它在软化教师分布和改善知识转移方面的核心作用。在这项工作中,我们重新审视 LLM 蒸馏 中的温度,并表明它从根本上改变了 FKL 和 RKL 之间的比较。我们的分析揭示了一种不对称效应:温度极大地丰富了 FKL 的非主导词元信号,而它主要重新调整了 RKL 梯度,导致 FKL 比 RKL 从 $τ$ 缩放中受益更多。这种不对称性推翻了标准的经验结论:尽管 RKL 在 $τ=1$ 时优于 FKL,但在指令跟踪基准测试中,FKL 在较高温度下始终优于 RKL。而且,温度的影响不仅仅限于FKL;它改进了更广泛的 蒸馏 目标系列,使基于 KL 的简单方法能够实现与最新最先进的 LLM 蒸馏 方法相比的竞争性能。