论文
多块扩散语言模型
Multi-Block Diffusion Language Models
摘要
块扩散语言模型 (BD-LM) 通过 KV 缓存和灵活长度生成改进基于扩散的文本生成。自然的下一步是将它们从单块扩散(SingleBD)扩展到多块扩散(MultiBD),其中连续块的运行集被同时解码以实现块间并行性。然而,现有的 BD-LM 大多是在教师强制下进行训练的,其中模型仅观察到一个以干净前缀为条件的噪声块。虽然最近的扩散强迫策略引入了多个噪声块之间的可见性,但其训练状态仍然不同于 MultiBD 推理,其中解码在具有异构时隙噪声模式的有界运行集上进行操作。为了弥补这一差距,我们提出了多块扩散语言模型(MBD-LM),由 后训练 BD-LM 和多块教师强制(MultiTF)获得。 MultiTF 通过对以干净前缀为条件的有界噪声组进行训练来集成教师强迫和扩散强迫,并使用更好地匹配 MultiBD 推理状态的随机噪声调度程序。为了使 MultiBD 切实可行,我们进一步引入了一种基于块缓冲区机制的优化解码算法,该算法保留前缀缓存重用,保持输入形状静态,并将增加的解码并行性转化为挂钟加速。根据经验,MBD-LLaDA2-Mini 将每次前向传递的平均词元数 (TPF) 从 3.47 增加到 6.19,并将平均准确率从 79.95% 提高到 81.03%;与 DMax 结合使用时,MBD-LLaDA2-Mini-DMax 的平均 TPF 达到 9.34,数学和代码基准测试的准确度仅下降 1.02%。