论文

分层连续扩散语言模型

Hierarchical Continuous Diffusion Language Models

模型架构新型架构

摘要

离散扩散语言模型为需要双向推理和全局约束满足的任务提供了自回归生成的引人注目的替代方案。然而,它们有一个结构瓶颈:并行解码时,每个词元都与其边际独立采样,从而切断了一起解码的词元之间的统计依赖性。连续扩散语言模型通过对共享连续状态进行降噪来避免这种情况,但它们的降噪器只能看到该状态,因此在最终解码之前没有任何东西将其与有效的词元配置联系起来。为了解决这个问题,我们提出了分层连续扩散语言模型(HC-DLM),它将离散标记生成与连续潜在轨迹结合在一个有原则的去噪过程中,其训练目标是从标记可能性的变分界限中得出的。与最近将连续上下文附加到独立的离散链的方法相比,HC-DLM 使潜状态成为唯一持久的生成状态:每一步都会从中读出词元,并作为下一次潜在更新的支架进行反馈。在结构化推理(数独)、数学规划(倒计时)和语言建模(LM1B)方面,HC-DLM 在匹配模型大小的离散和连续扩散基线、数独和倒计时的谜题准确性以及 LM1B 的生成困惑度方面都有所改进。项目页面:https://hc-dlm.github.io/.