论文
UNIFUSION:在统一反向速率目标下将自回归语言模型调整为离散扩散
UNIFUSION: Adapting Autoregressive Language Models into Discrete Diffusion under a Unified Reverse-Rate Objective
摘要
现有方法主要将预训练的自回归(AR)语言模型适应掩模扩散,而我们直接将它们适应均匀噪声扩散,其中每个标记在采样期间保持可编辑。然而,跨腐败内核调整 AR 检查点仍然具有挑战性,因为现有的 DLM 使用不同的目标和预测参数化。我们通过将 SEDD、MDLM/GIDD、M2S 和神经 CTMC 的条件损失表示为模型反向率上的单个广义 Kullback-Leibler 目标,在 SEDD、MDLM/GIDD、M2S 和神经 CTMC 之间建立联系。我们进一步推导从干净词元预测到具体分数、后验均值和退出率/跳跃参数化的转换,产生一个支持掩码和统一内核之间切换的共享 \(x_0\) 接口。基于这些联系,我们提出了 \ours{},一种简单的连续 预训练 方法,用于直接使预训练的 GPT2 检查点适应均匀噪声扩散。通过对 124M 和 355M 参数模型的系统评估,我们表明,随着采样预算从 16 步增加到 256 步,\ours{} 稳步改善了生成困惑度 (GenPPL) 和一元熵之间的权衡。在 256 个步骤中,\ours{}-S 和 \ours{}-M 分别实现了 \(97.783/5.2626\) 和 \(71.516/5.6669\) 的 GenPPL/熵对;没有任何一个相同规模的评估模型在这两个指标上同时优于我们的{}。在这两个尺度上,\ours{} 在比较的扩散模型中也实现了最高的 WinoGrande、SIQA 和 BBH 精度。