论文
扩散和自回归语言模型生成的文本的差异
Differences in Text Generated by Diffusion and Autoregressive Language Models
摘要
扩散语言模型 (DLM) 是自回归语言模型 (ARM) 的有希望的替代品,但其生成的文本的内在差异仍未得到充分探索。我们首先凭经验发现现成的 DLM 表现出较低的 $n$-gram 熵、较高的语义一致性和较高的语义多样性。为了了解原因,我们进行了对照实验,将训练目标和解码算法的影响解耦。结果表明,DLM 训练目标有助于语义一致性和语义多样性的增加,但对熵的影响较小。这些差异主要是由双向上下文驱动的;训练目标中的其他组成部分,例如输入掩蔽、标签掩蔽和加权函数,影响要弱得多。此外,我们的实验表明,熵的减少源于 DLM 的解码算法,特别是基于置信度的重新屏蔽策略。我们为这种熵减现象提供了理论理解。我们的工作共同揭示了 DLM 和 ARM 在文本生成方面差异背后的关键机制,并为 DLM 中的训练目标和解码算法的未来设计提供信息。