论文

用于掩蔽扩散模型的 VGB:有效的测试时间缩放以实现奖励满意度和样本编辑

VGB for Masked Diffusion Model: Efficient Test-time Scaling for Reward Satisfaction and Sample Editing

模型推理解码与生成控制

摘要

推理时间缩放是改进生成模型的一种有前途的范例,特别是当输出必须满足结构约束或优化下游奖励时。我们考虑掩蔽扩散模型 (MDM) 并引入 MDM-VGB,这是一种离散扩散采样器,可通过理论上原则性的奖励引导重掩蔽来增强揭露生成。受经典 Jerrum-Sinclair 回溯马尔可夫链最近在奖励倾斜生成中取得成功的启发,MDM-VGB 将回溯随机游走从固定前缀树扩展到屏蔽状态图,允许在任意位置取消屏蔽和重新屏蔽词元。由此产生的采样器有利于解锁和重新屏蔽动作,从而产生更高价值的部分配置,从而实现有效的高奖励生成和低奖励样本的有效修复。我们证明 MDM-VGB 对过程验证器噪声具有鲁棒性,并实现二次复杂度,而流行的测试时启发式算法(例如 best-of-$N$)可能会因错误累积而产生指数复杂度。我们的理论发现得到了强大的实证表现的证实,特别是在流行的约束满足和科学基准(例如数独和 QM9)方面。