论文

用于少步生成的多掩模扩散语言模型

Multi-Mask Diffusion Language Models for Few-Step Generation

模型架构新型架构

摘要

掩蔽扩散模型(MDM)是一个很有前景的语言生成器系列,但实现高质量的几步生成仍然具有挑战性。在 MDM 中,所有前向轨迹都崩溃为单个完全屏蔽状态,不会为一致性式的少步生成留下任何终端熵。虽然最近基于统一状态扩散的几个步骤替代方案避免了这种退化,但与 MDM 相比,区分干净标记和噪声变得更加困难,这通常会损害建模质量和训练效率。在这项工作中,我们提出了一种多掩模扩散模型(MultiMDM),它可以保留掩模结构以实现少步生成。在前向过程中,每个干净的词元首先被推向指定的掩模,然后逐渐在掩模组上混合。因此,后向过程通过在精炼为干净词元之前预测指定掩码来具有起草能力。我们为 MultiMDM 推导了一个封闭式 ELBO 训练目标,支持从预训练的 MDM 进行持续训练。此外,我们制定了一个纯离散状态一致性 蒸馏 方案,通过共享 Gumbel 耦合来减少路径熵。预训练和 蒸馏 的实验表明,MultiMDM 为有原则的少步生成提供了有效的基础。