论文

超越面具:通过删除-插入过程实现高效、灵活的扩散语言模型

Beyond Masks: Efficient, Flexible Diffusion Language Models via Deletion-Insertion Processes

模型架构新型架构

摘要

虽然依赖于标记掩码和去掩码的掩码扩散语言模型(MDLM)在语言建模中显示出了前景,但它们的计算效率和生成灵活性仍然受到掩码范式的限制。在本文中,我们提出删除-插入扩散语言模型(DID),该模型严格地将标记删除和插入制定为离散扩散过程,取代当前 MDLM 中的屏蔽和取消屏蔽过程。 DID 通过消除 MDLM 中计算开销的两个主要来源来提高训练和推理效率:对非信息性 1) <MASK> 范式固有的标记的计算,以及 2) 在可变长度设置中引入的 <PAD> 标记。此外,DID 通过以下方式提供了更大的灵活性:1)本机支持可变长度序列,无需固定长度填充;2)由于插入动态调整词元位置,因此在生成过程中具有内在的自我校正机制。为了训练 DID,我们设计了一种基于分数的方法,为词元插入操作分配分数并得出适当的训练目标。目标涉及子序列计数问题,我们通过并行动态编程算法有效地解决这些问题。我们在固定和可变长度设置上的实验证明了 DID 相对于 MDLM 和现有基于插入的 LM 的基线在建模性能、采样质量和训练/推理速度方面的优势,且无需任何超参数调整。