论文

连续潜在扩散语言模型

Continuous Latent Diffusion Language Model

模型架构新型架构

摘要

大语言模型 在自回归范式下取得了显着的成功,但高质量的文本生成不需要依赖于固定的从左到右的顺序。现有的替代方案仍然难以共同实现生成效率、可扩展的表示学习和有效的全局语义建模。我们提出了 Cola DLM,一种分层潜在扩散语言模型,通过分层信息分解构建文本生成。 Cola DLM 首先使用文本 VAE 学习稳定的文本到潜在映射,然后使用块因果 DiT 在连续潜在空间中对全局语义先验进行建模,最后通过条件解码生成文本。从统一的马尔可夫路径的角度来看,其扩散过程执行潜在的先验传输而不是词元级观察恢复,从而将全局语义组织与局部文本实现分开。这种设计产生了更灵活的非自回归归纳偏差,支持连续空间中的语义压缩和先验拟合,并自然地扩展到其他连续模态。通过涵盖 4 个研究问题、8 个基准、严格匹配的 ~2B 参数自回归和 LLaDA 基线以及高达约 2000 EFLOP 的缩放曲线的实验,我们确定了 Cola DLM 的有效整体配置,并验证了其强大的文本生成缩放行为。总而言之,结果建立了分层连续潜在先验建模作为严格 词元级 语言建模的原则性替代方案,其中生成质量和缩放行为可能比可能性更好地反映模型能力,同时还提出了跨离散文本和连续模态统一建模的具体路径。