论文
减少扩散语言模型中的预训练生成不匹配
Reducing Pretraining-Generation Mismatch in Diffusion Language Models
摘要
扩散语言模型 (dLLM) 通过迭代去噪生成文本,允许并行预测多个标记。然而,预训练可能会掩盖整个序列中的标记,而提示完整前缀上的延续条件。这种差异仍然存在于在稳定阶段对整个序列进行降噪的转换管道中。我们提出前缀条件扩散(PCD),它对边界进行采样,保留前缀并对后缀进行去噪。训练方法还将自回归监督应用于前缀。我们在预热、稳定和衰减转换管道的稳定阶段评估 PCD,推理不变。跨模型系列的匹配实验表明,与本机扩散训练相比,推理和编码方面有所改进。匹配的持续研究进一步表明,在共同的衰减阶段后,优势仍然存在。在单独的重建诊断中,随着更多评估前缀标记被屏蔽,完整的 PCD 配方相对于本地扩散训练的优势就会逆转。对照实验显示,具有干净的训练前缀、完整的评估前缀和无自回归损失的后缀重建损失较低。