论文
面向块扩散语言模型的无偏 在策略蒸馏
Towards Unbiased On-Policy Distillation for Block Diffusion Language Models
摘要
在策略蒸馏 (OPD) 已成为语言模型的有效后训练范例,最近的努力将其扩展到块扩散语言模型 (BDLM)。然而,现有的研究几乎完全集中在小块尺寸上,而蒸馏成具有较大块的学生模型模型尚未得到充分探索。在这项工作中,我们研究了这种机制并揭示了导致严重训练不稳定的两个关键优化偏差。首先,教师模型和学生模型之间不匹配的块边界会导致 \textbf{\textit{上下文错位}},从而提供扭曲的监控信号,从而误导学生模型解码。其次,即使在一致的背景下,OPD 中的 \textbf{\textit{内在优化偏差}}(学生模型往往会快速吸收高支持信号,同时滞后于低支持更新)会导致过早的信心激增,使较弱的学生陷入灾难性的过度自信崩溃。为了解决这些问题,我们提出了 \mbox{Un-OPD},一个无偏的 在策略蒸馏框架,具有两个用于稳定 BDLM 训练的新颖性。首先,Un-OPD 引入了边界感知步骤过滤策略,消除了上下文未对齐的解码步骤。其次,Un-OPD 提出通过支撑重新平衡置信校准来调节高支撑位置的优化强度,从而绕过过度自信崩溃。除了稳定性之外,我们还引入了执行轨迹重用机制来减少执行轨迹的生成开销。关于数学推理和代码生成基准的大量实验表明,Un-OPD 始终稳定训练并提供卓越的性能,同时将挂钟训练时间减少大约一半。