论文

具有无 BPTT 循环细化的无前向扩散语言模型

Forward-Free Diffusion Language Models with BPTT-Free Looped Refinement

模型训练预训练

摘要

扩散语言模型通过迭代去噪生成文本,为自回归生成提供了强大的替代方案。然而,离散语言空间缺乏定义有效扰动的自然邻域结构,从而在前向过程中激发人为损坏方案。这种规定的前向过程通常会产生数学上方便的状态,但与生成过程中遇到的草稿和错误不一致,导致样本质量下降。为了解决这个限制,我们提出了 FReDA,一种无前向扩散语言模型,消除了手工设计前向过程的需要。我们将扩散语言建模表述为递归分布细化,其中模型生成的草稿充当隐式中间状态,学习的细化模型逐渐将草稿分布移向目标分布。训练会分离前面的细化过程,并仅通过最终过程进行反向传播,避免细化迭代中的时间反向传播 (BPTT),同时在最终 Transformer 过程中保留标准反向传播。具体来说,FReDA 通过提出候选序列并直接执行自我细化或通过 Best-of-N 细化在并行候选者中进行选择来细化草稿。通过这种设计,FReDA 与邻域无关、采样器自适应,并且与灵活的细化参数化兼容。 sub-8B 体系中的广泛评估表明,FReDA-4B 在推理和编码基准方面优于更大的扩散基础模型,实现高达 15% 的绝对增益,同时达到扩散基线的 1.5-1.8 倍平均加速,并通过额外的细化计算有效扩展。