论文
关于掩蔽扩散语言模型的轨迹感知训练
On Trajectory-Aware Training for Masked Diffusion Language Models
摘要
掩码扩散模型 (MDM) 通过每步揭开多个标记来生成文本,但它们是在不同条件下进行训练和采样的。该模型是在随机屏蔽序列上进行训练的,而推理则遵循模型自身预测形成的轨迹。此外,每个步骤都无法访问前一个步骤的计算结果。最近的方法从不同的角度缩小了这些限制,使这些选择如何相互作用保持开放。我们引入了 PUMBA,一个用于轨迹感知训练的统一框架,它在策略诱导轨迹的连续步骤上训练降噪器,在步骤之间传递信息,并通过时间反向传播来联合优化它们。对该设计空间的一项对照研究表明,i)由于局部过度拟合,精确的训练-推理对齐失败,而较宽松的对齐仍然使训练掩模更接近推理时看到的掩模; ii) 通过每一步的承诺,传递连续信息优于离散梯度估计器; iii)随着时间跨度的反向传播更多步骤,性能得到提高,我们在理论上支持这一点。组合起来,这些组件与相同大小的自回归模型的最佳检查点相匹配。基于这些发现,我们将 PUMBA 扩展到 LLaDA-8B 的监督微调,它改善了全画布和块扩散生成中性能和函数评估 (NFE) 数量之间的权衡。在性能匹配的情况下,与标准微调相比,它需要的 NFE 减少高达 22%,全画布生成的预算是标准微调的两倍,而对于块扩散中相同步数的标准微调,它需要的 NFE 减少高达 26%。