论文
SelFusion:用于扩散语言模型的 Self-蒸馏
SelFusion: Self-distillation for Diffusion Language Models
摘要
扩散语言模型 (DLM) 缓解了自回归 (AR) 大语言模型 (LLM) 固有的延迟瓶颈,但其生成质量下降限制了实际适用性。尽管 知识蒸馏 (KD) 可能是提高性能的一个有前途的方向,但我们根据经验发现,天真地应用传统的 KD 只能产生边际收益,甚至会降低生成质量。基于这些观察,我们提出了一种新颖的 DLM 自 蒸馏 框架,即 SelFusion。为了在没有外部教师模型的情况下实现有效的 KD,SelFusion 使用不同的掩蔽级别执行两次前向传递,定义具有较大掩蔽概率的困难模式和具有较小掩蔽概率的简单模式。然而,简单模式并不总是比困难模式更准确,并且可能会对不正确的标记过于自信。因此,我们在两种模式之间引入双向KD,它可以根据词元级的正确性动态确定蒸馏的方向。指令跟踪任务的实验结果表明,所提出的自 蒸馏 大大优于具有外部 LLM 和 DLM 教师的其他 KD 方法。在许多配置中,使用 SelFusion 训练的学生甚至超越了 LLM 教师的表现,为提高 DLM 生成质量提供了实用途径。源代码可以在 https://github.com/scai-research/SelFusion_official 找到