论文
知识蒸馏的分布图
The Distributional View of Knowledge Distillation
摘要
词元级 知识蒸馏 (KD) 匹配每个位置的两个条件分布,但标准目标逐点比较它们:Kullback-Leibler 梯度不知道哪个错误标记接收概率质量。我们开发了一种分布视图,其中教师不是由单个软化输出表示,而是由一系列多温度视图(其 logits 的退火路径的边缘)代表,并且学生在基于嵌入的地面成本下针对这些视图的几何感知聚合进行训练。我们形式化了由此产生的设计空间(混合、对数线性池、熵 Wasserstein 重心以及中心和路径形式的去偏 Sinkhorn 发散旗舰),证明了精确的崩溃结果,显示了调和视图的对数线性池相当于单个温度,并给出了产生可证伪预测的多边缘薛定谔桥读数。在指令调整的 Pythia 对上,实验产生了三个经验定律:(i)色散定律 - 多温度聚合的好处随着视图的有效温度色散而不是其数量单调增长; (ii) 分散视图解锁聚合算子——当基于传输的聚合开始击败平均时,重心与算术混合完全分离; (iii) 受上限差距控制的两种机制图像$ Γ=\mathrm{PPL}_{\mathrm{SFT}}-\mathrm{PPL}_{T}$:当经过微调的教师勉强击败受监督的学生时,温和的传输目标是最好的KD损失,但没有KD击败受监督的微调,而在真正的上限下,排名反转 - 以及保真度泛化的符号相关性翻转。我们认为“哪个 蒸馏 损失是最好的”不是损失的固定属性,而是 $Γ$ 的函数。