论文
以联合连续扩散去噪词元与层次语义表示
Denoising Hierarchical Representations: Joint Continuous Diffusion for Language Modeling
摘要
扩散语言模型 (DLM) 有望实现与顺序无关的并行文本生成。最近,在精心设计的 token 表示和扩散/流动空间的推动下,连续扩散和流动匹配模型取得了巨大的进步。在这项工作中,我们引入了分层连续扩散语言模型 (H-CDLM),这是一个简单的框架,可以以最小的计算和参数开销进一步改进连续 DLM。借鉴离散 DLM 和连续图像扩散有关联合扩散的文献,我们并行扩散多种模态。这些模态以不同的语义粒度表示 token:在我们的实例化中,token 本身以及通过对预训练的 token 嵌入进行聚类而获得的更粗的集群。我们提出了一种通用设置,允许按模态采样器和时间表来增强模态之间的相互作用。应用于 CoBit 时,会产生 H-CoBit,它在基准测试中带来了巨大的经验收益。在数据集熵方面,H-CoBit 改进了 MAUVE,并在 LM1B 上达到了 49.4 的生成困惑度 (GenPPL),在 OWT 上达到了 50.4,比基线提高了 24.2 和 20.7 个点,甚至超过了同等大小的离散 DLM。在 GSM8K 上,它的准确率达到 27.4%,优于之前的连续扩散和基于流的模型。我们进一步将 H-CDLM 应用于流匹配模型 FLM,通过 H-FLM 获得一致的增益,并证明该框架可以泛化到连续生成范式。我们的代码将在 https://github.com/matol-16/HCDLM.git 上公开。