论文

重新审视均匀扩散模型:留一去噪器和吸收状态重构

Uniform Diffusion Models Revisited: Leave-One-Out Denoiser and Absorbing State Reformulation

模型训练预训练

摘要

离散扩散模型通常通过干净数据预测进行训练,但可以以不同的方式使用预测来定义反向动态。在掩模扩散模型 (MDM) 中,这些选择很大程度上一致,而在均匀扩散模型 (UDM) 中则不然。我们表明,UDM 的标准插件桥参数化不是通过去噪后验来优化的,而是通过留一后验来优化的,该留一后验可以在不使用其自己的噪声观察的情况下预测每个干净标记。这表明插件 ELBO 和通常的交叉熵去噪目标之间不匹配。我们描述留一目标的特征,并推导降噪器、留一后验和分数之间的精确转换。这些转换使我们能够区分参数化和训练目标。我们的结果还通过知情的预测校正器采样器和基于留一预测器的改进的温度采样来改进推理,而无需任何额外的训练。我们进一步引入了均匀扩散的吸收状态重构,它保留了 UDM 联合定律,同时将其分解为类似掩模扩散的采样操作,具有更简单的去噪后验、遗留去掩模和自然的重新掩模机制。在语言建模方面,留一法参数化持续改进 UDM 生成,而吸收结构则匹配或超越掩模扩散。这些结果表明,掩蔽扩散和均匀扩散之间的经验差距较少是由边际本身的选择驱动的,而是由参数化和抽样设计驱动的。代码和模型可以在 https://github.com/samsongourevitch/rev_udm 找到。