论文

语言建模的词元时间连续扩散

Token Time Continuous Diffusion for Language Modeling

模型架构新型架构

摘要

在本文中,我们介绍了词元时间连续扩散(TTCD),这是一种新的扩散语言模型,它(a)在连续空间中运行,确定性地将高斯噪声映射到最终词元画布,无需进一步采样,并且至关重要的是(b)结合了每个词元时间的新概念,一些词元以比其他词元更快的速度从噪声到词元。连续空间建模有助于 TTCD 避免多个标记的并行采样,这是纯粹在离散空间中迭代的模型高速加速时不准确的一个关键来源。每个词元时间的概念有助于 TTCD 更好地模拟条件生成,允许更确定的词元以更快的速度进行,并允许在细化过程中区分词元间的影响。 TTCD 在高加速下的性能优于离散模型。我们在OpenWebText上训练一个160M参数的TTCD模型,然后自蒸馏;我们发现,在高加速下,我们在无条件生成质量方面具有可比性,并且在条件生成方面表现优于条件生成,几个现有的类似大小的模型在相同的数据上进行训练并自我蒸馏。我们在数独求解中也取得了类似的成果。