论文
掩模扩散模型中的递归缩放
Recursive Scaling in Masked Diffusion Models
摘要
屏蔽扩散模型 (MDM) 通过迭代细化部分屏蔽状态并并行提交词元来生成序列。我们在 MDM 中引入递归,并提出新的递归掩模扩散模型 (R-MDM),该模型在每个去噪步骤中应用共享去噪 Transformer $L$ 次,添加递归深度作为额外的计算轴,而不增加参数数量。在结构化生成任务中,递归深度可以提高固定参数预算下的质量,以匹配的 FLOP 匹配更大的非递归模型,并且可以减少达到目标质量所需的去噪步骤数。我们用并行解码误差的依赖性保真度分解来解释这些增益:递归在固定的屏蔽状态下细化模型边缘,而去噪步骤通过提交标记来改变该状态。在此分析的基础上,我们建议将解码视为两轴决策(要运行多少个循环以及要提交哪些词元),并表明熵引导的自适应规则可以提高质量 - 在固定时间表上计算前沿,在数独、倒计时、RNA 和可执行数学生成上的各种任务之间进行传输。总之,这些结果将递归深度确立为 MDM 的实用、互补的测试时间缩放机制。