论文
如何与潜在空间联合训练潜在扩散语言模型
How to Train Your Latent Diffusion Language Model Jointly With the Latent Space
摘要
潜在扩散模型通过对连续文本表示进行操作并并行对整个序列进行去噪,为非自回归文本生成提供了一种有吸引力的离散扩散替代方案。潜在扩散建模的主要挑战是构建合适的潜在空间。在这项工作中,我们提出了潜在扩散语言模型(LDLM),其中潜在编码器、扩散模型和解码器被联合训练。 LDLM 通过使用可训练编码器重塑预训练语言模型的表示来构建其潜在空间,产生易于去噪和解码为标记的潜在空间。我们证明,朴素联合训练会产生低质量的扩散模型,并提出了一种简单的训练方法,其中包括 MSE 解码器损失、扩散到编码器预热、自适应时间步采样和解码器输入噪声。烧蚀表明每个组件都会极大地影响生成性能。在 OpenWebText 和 LM1B 上,LDLM 比现有的离散和连续扩散语言模型实现了更好的生成性能,同时速度提高了 $2{\text -}13\times$,这表明联合学习潜在空间是使潜在扩散在文本生成方面具有竞争力的关键一步。