论文

扩散语言模型中不变和独立解码的统一能量

Unified Energy for Invariant and Independent Decoding in Diffusion Language Models

模型推理解码与生成控制

摘要

扩散语言模型 (DLM) 通过迭代地对整个序列进行去噪来实现并行文本生成,与自回归 (AR) 解码相比,提供了极具吸引力的灵活性。然而,现有方法无法完全捕获词元关系,导致相对于 AR 基线的性能差距,特别是随着并行度的增加。在本文中,我们对差距进行了系统分析,确定了三个关键因素:(i)模型能力,(ii)依赖性和(iii)不变性。为了解决这些问题,我们首先提出不变能量(Inv-E)和有效的基于采样的估计器来处理不变性问题。通过进一步与独立能量(Ind-E)结合,我们得到一个统一能量(Uni-E),它解释了所有这些因素。 Uni-E具有独特的优势:无需基于采样的分区估计即可精确计算。此外,Uni-E 与模型无关,因此可以扩展到任意大小的模型。我们进一步证明Uni-E可以纠正由依赖性和不变性引起的分布偏移。扩散语言模型 (DLM) 和扩散 大语言模型 (DLLM) 的广泛实验证明了所提出的 Uni-E 的有效性。