论文
理解和加速掩蔽扩散语言模型的训练
Understanding and Accelerating the Training of Masked Diffusion Language Models
摘要
掩蔽扩散模型 (MDM) 已成为语言建模中自回归模型 (ARM) 的有前途的替代方案。然而,众所周知,MDM 的学习速度比 ARM 慢得多,这在将 MDM 扩展到更大的模型时可能会出现问题。因此,我们提出以下问题:如何在保持其最终性能的同时加速标准 MDM 训练?为此,我们首先详细分析MDM训练缓慢的原因。我们发现主要因素是语言的局部性偏差:标记的预测信息集中在附近的位置。我们进一步研究了这种偏差如何减慢学习速度,并提出了一种简单而有效的补救措施:钟形时间采样作为训练策略。值得注意的是,使用我们的训练配方训练的 MDM 达到相同的验证负对数似然 (NLL) 的速度比十亿字基准 (LM1B) 上的标准训练快 $\sim4\times$。我们还在各种基准测试中展示了生成困惑度、零样本困惑度和下游任务性能的更快改进。