论文
语言的连续扩散与离散扩散具有竞争性
Continuous Diffusion Scales Competitively with Discrete Diffusion for Language
摘要
虽然扩散最近引起了语言建模界的相当多的关注,但连续扩散似乎比离散方法的可扩展性更差。为了挑战这一信念,我们重新审视 Plaid,一种基于可能性的连续扩散语言模型 (DLM),并通过将 Plaid 的架构与现代离散 DLM 结合起来构建 RePlaid。在这个统一的设置中,我们为连续 DLM 建立了第一个可与离散 DLM 相媲美的缩放法则:与自回归模型相比,RePlaid 的计算差距仅为 20 美元\times$,在使用较少参数的情况下优于 Duo,并且在过度训练的情况下优于 MDLM。我们将 RePlaid 与最近的连续 DLM 进行基准测试:在 OpenWebText 上,RePlaid 在连续 DLM 和卓越的生成质量中实现了 22.1 美元的最新 PPL 界限。这些结果表明,当通过可能性进行训练时,连续扩散是离散 DLM 的一种极具竞争力和可扩展性的替代方案。此外,我们提供理论见解来理解基于可能性的训练的优势。我们表明,优化噪声调度以最小化 ELBO 的方差自然会随着时间的推移产生线性交叉熵(信息损失)。这均匀地分布了去噪难度,而无需任何特定情况的时间重新参数化。此外,我们发现通过似然优化嵌入可以创建结构化几何形状并驱动最显着的似然增益。