论文

LangFlow:连续扩散在语言建模中与离散相媲美

LangFlow: Continuous Diffusion Rivals Discrete in Language Modeling

模型架构新型架构

摘要

连续扩散是图像等许多数据模式的高保真、可控和少步生成的基础。然而,在语言建模中,由于数据空间稀疏和设计空间探索不足,先前的连续扩散语言模型(DLM)落后于离散模型。在这项工作中,我们通过 Bregman 散度将嵌入空间 DLM 连接到流匹配,缩小了与 LangFlow 的差距,LangFlow 是第一个可与离散扩散相媲美的连续 DLM,同时还有三个关键创新:(1)我们推导出一种新颖的基于 ODE 的 NLL 界限,用于对基于连续流的语言模型进行原则性评估; (2)我们提出了一种用于设置噪声调度的信息一致原则,该原则激发了基于Gumbel分布的可学习噪声调度器; (3)我们通过结合自我调节来修改先前的训练协议,因为我们发现它提高了嵌入空间 DLM 的可能性和样本质量,其效果与离散扩散有很大不同。综合起来,LangFlow 在困惑度 (PPL) 和生成困惑度 (Gen. PPL) 上都可以与顶级离散 DLM 相媲美,在 LM1B 上达到 30.0 的 PPL,在 OpenWebText 上达到 24.6 的 PPL。它甚至在 7 个基准测试中的 4 个上超过了零样本迁移的自回归基线。 LangFlow 提供了第一个明确的证据,证明连续扩散是语言建模的一个有前途的范例。主页:https://github.com/nealchen2003/LangFlow