论文
大语言模型 蒸馏 的多样性感知反向 Kullback-Leibler 散度
Diversity-Aware Reverse Kullback-Leibler Divergence for Large Language Model Distillation
摘要
反向 Kullback-Leibler (RKL) 散度最近已成为 大语言模型 (LLM) 蒸馏 的首选目标,其表现始终优于正向 KL (FKL),特别是在词汇量大且师生能力严重不匹配的体系中,其中 RKL 侧重于学习主导模式而不是强制执行密集对齐。然而,RKL 引入了结构性限制,导致学生做出过于自信的预测。我们首先通过将 RKL 的梯度分解为目标和非目标分量来对 RKL 进行分析,结果表明,即使学生已经与教师匹配,非目标梯度也会持续推动目标 logits 向上,从而减少输出多样性。此外,RKL 对非目标类别的监督较弱,导致尾部对齐较差。为了解决这些问题,我们提出了多样性感知 RKL(DRKL),它消除了这种梯度效应并加强了非目标监督,同时保留了 RKL 的优化优势。跨数据集和模型系列的大量实验表明,DRKL 始终优于 FKL、RKL 和其他最先进的 蒸馏 目标,实现了更好的性能和卓越的保真度与多样性权衡。