论文

DA-DLM:在扩散语言模型中显式建模标记依赖性

DA-DLM: Explicitly Modeling Token Dependencies in Diffusion Language Models

模型架构新型架构

摘要

扩散语言模型 (DLM) 通过迭代对屏蔽序列进行去噪来生成文本,并在每一步独立预测多个标记。这种条件独立性丢弃了词元间依赖性并降低了一致性——这个问题与非自回归翻译(NAT)中的多模态问题类似。有向无环变换器 (DAT) 通过有向无环图 (DAG) 解决了 NAT 中的这一问题,我们利用该模型提出了 DA-DLM,这是一种通过面向位置的 DAG 设计将基于 DAG 的依赖建模适应 DLM 迭代设置的模型。面向位置的 DAG 将节点组绑定到固定的输出位置,以便在早期步骤中固定的标记通过学习的转换来锚定相邻预测,并随着锚的积累而随着去噪而发展,以关注剩余的不确定性。在语言建模、开放式生成和摘要方面,DA-DLM 始终优于块扩散,尤其是在较少的去噪步骤下,并且在保留并行生成优势的同时匹配自回归模型。我们的代码可在 https://github.com/jipy0222/DA-DLM 上公开获取。