论文

TextLDM:具有连续潜在扩散的语言建模

TextLDM: Language Modeling with Continuous Latent Diffusion

模型架构新型架构

摘要

在 VAE 潜在空间中通过流匹配训练的扩散 Transformer (DiT) 具有跨图像和视频的统一视觉生成。面向生成(视觉合成)和理解(文本生成)的单一架构的下一步自然是将该框架应用于语言建模。我们提出了 TextLDM,它将视觉潜在扩散配方转移到文本生成,并且只需最少的架构修改。基于 Transformer 的 VAE 将离散标记映射到连续潜在变量,并通过表示对齐 (REPA) 和冻结的预训练语言模型进行增强,以生成对条件去噪有效的表示。然后,标准 DiT 在这个潜在空间中执行流匹配,其架构与其视觉对应物相同。我们解决的核心挑战是获得高质量的连续文本表示:我们发现仅重建保真度是不够的,通过 REPA 将潜在特征与预训练语言模型对齐对于下游生成质量至关重要。 TextLDM 在 OpenWebText2 上从头开始训练,其性能大大优于先前的扩散语言模型,并且在相同设置下与 GPT-2 相匹配。我们的结果表明,视觉 DiT 配方可以有效地转换为语言,为多模式生成和理解的统一扩散架构迈出了具体的一步。