论文

DSL-LLaDA:将连续降噪扩展到 8B 掩模扩散 LM

DSL-LLaDA: Scaling Continuous Denoising to 8B Masked Diffusion LMs

模型训练预训练

摘要

离散掩码扩散语言模型通过迭代并行解码生成文本,但少步解码需要在长度和质量之间进行权衡:在固定的步骤预算下,标准方法可以生成简短的高质量输出,或者可以生成长但重复的文本。连续去噪可以通过在嵌入空间中共同演化所有位置来回避这种权衡,但从头开始大规模构建这样的模型仍然是一个悬而未决的问题。我们表明,可以稍微调整预训练的屏蔽 DLM 以支持连续嵌入空间去噪。从 LLaDA-8B-Instruct 开始,我们使用离散随机定位 (DSL) 继续预训练仅 1,000 个步骤,用连续的每个标记高斯噪声作为软掩码替换二进制掩码。适应后的模型支持连续推理,在嵌入空间中共同演化所有位置,并将硬词元承诺推迟到最后一步。在低步预算(<=16 次前向传递)下的零样本汇总中,DSL-LLaDA-SDE 在所有四个基准上实现了最佳 ROUGE-1,并在很大程度上避免了迭代揭露的过早终止/重复权衡。同样的适应还产生了选择性的噪声状态鲁棒性:模型纠正损坏的标记,同时保留干净的标记。使用具有相同计算的标准掩蔽扩散训练的对照实验表明这两种行为都没有。