论文
一致的扩散语言模型
Consistent Diffusion Language Models
摘要
扩散语言模型 (DLM) 是自回归模型的一个有吸引力的替代方案,因为它们承诺亚线性时间、并行生成,但由于高质量样本仍然需要数百个细化步骤,因此实际收益仍然难以捉摸。在连续领域中,沿概率流 ODE 进行一致性训练是加速扩散的常用方法。对于离散扩散,不存在类似的样本空间 ODE,使得直接适应不明确。我们认为,正确的离散替代是精确的后桥,即连接任意两个噪声水平的封闭形式条件律,可用于广泛的损坏,包括屏蔽和均匀扩散。基于这一观察,我们引入了多路径离散一致性(MPDC),这是一种新原理,可以训练降噪器在这些随机桥上保持路径不变,并将其实例化为一致扩散语言模型(CDLM),这是一种单阶段训练框架,不需要已经训练过的教师模型。我们的 CDLM 目标恢复掩模扩散、连续一致性模型以及渐进或离散 蒸馏 作为一种常见观点的分析极限或经验近似。根据经验,CDLM 在条件和无条件文本生成方面建立了一种新的技术水平,始终优于强基础离散扩散模型,甚至通常跨采样预算的多阶段蒸馏基线,在几步机制中收益最大。总之,这些结果使 CDLM 成为下一代快速、高保真离散生成建模的原则性和可扩展的基础。