论文
修改,不要冻结:自校正掩蔽扩散语言模型的采样器匹配训练
Revise, Don't Freeze: Sampler-Matched Training for Self-Correcting Masked Diffusion Language Models
摘要
掩蔽扩散语言模型 (MDLM) 会在每个去噪步骤中重新预测每个位置,但标准采样器一旦显示就会提交标记,从而使此修正功能未使用。现有的方法要么添加启发式或学习机制来修改提交的词元,要么在重新预测之前将它们重新屏蔽回[MASK];无需辅助模块即可直接修改可见标记的原则性采样器仍未得到充分探索。我们引入了 D3IM,这是一种无参数采样器,作为校正器式反向更新而派生,允许直接可见到可见的修订,而无需额外的模块或辅助通道。 D3IM 还揭示了一个模型方面的障碍,我们称之为保留偏差:模型倾向于重现自己错误的提交词元,而不是纠正它们。我们通过 SCOPE(预测误差自调节)来解决这个问题,这是一个模拟 D3IM 采样过程的轻量级 后训练 程序。在 LLaDA-8B 上的 64 个去噪步骤中,SCOPE+D3IM 比原始 LLaDA-8B 的标准去掩蔽性能有了改进,在 GSM8K 上提高了 +13.0 (68.3%),在 MATH-500 上提高了 +4.8 (23.6%),在 HumanEval 上提高了 +15.3 (29.3%),在 MBPP 上提高了 +10.4 (30.8%),增益随着增加而增加。去噪步骤用于数学和 HumanEval。