论文

简单的扩散语言模型是比报道更有效的少步生成器

Simple Diffusion Language Models Are More Effective Few-Step Generators Than Reported

模型推理解码与生成控制

摘要

扩散语言模型(DLM)承诺快速并行生成,但高质量样本通常需要大量细化步骤,这削弱了它们在实践中的优势。这引起了人们对有效少步生成新方法的巨大兴趣并迅速发展。我们表明,在几个步骤中,大部分假定的质量差距可能是由配置不理想的采样器引起的。适度的采样器锐化,无需任何模型重新训练,使几年前的蒙版 DLM 能够与据称大大改进的后继者相媲美。事实上,这种不同采样的 DLM 只需 16 个步骤即可实现比其标准采样器通过 1024 步获得的生成困惑度更低的效果,同时提高了判断质量和语义多样性。我们进一步表明,传统的每输出指标可以从根本上掩盖这些收益,因为两个此类指标之间的任何最佳权衡都可以通过最多两个输出支持的生成器来实现。随后,我们引入了 GroupEval,它分别评估质量和跨输出语义多样性,并提供了新的见解,包括揭示蒸馏模型的 1.5-4.7 倍困惑度增益如何不会产生相应的质量增益。最后,我们解释为什么锐化有帮助:并行揭露破坏了同时生成的标记之间的依赖性,从而在预测和生成之间造成了差距。我们证明,即使对于精确的降噪器,在并行采样下,普遍的温度选择通常也是次优的,并且更糟糕的预测可以产生更好的样本。通过这些结果,我们主张采用更广泛的评估原则,将已部署的发电机作为比较对象,根据调整后的基线对其进行基准测试,并采用更人性化的措施联合评估质量和多样性。