论文
散度控制蒸馏中的熵
Divergence controls entropy in distillation
摘要
蒸馏已成为大语言模型训练的核心原语,但其性质尚未被充分理解。我们取熵的视角,研究学生熵如何依赖定义蒸馏目标的数据与散度。我们证明前向KL把学生熵抬高到教师之上;由于交叉熵训练是其特例,这给出一个我们在预训练与监督微调中定量验证的恒等式。其他散度无此保证:反向KL压低熵直到师生差距过大,二者间插值在训练早期平滑改变熵而在收敛时突变。在线蒸馏的低熵来自token级反向KL而非在线采样。散度因此充当隐式熵正则——其角色在自蒸馏中最清晰:当以特权信息为条件压低熵时,工作最好的散度超参数正是那些补偿它的。