论文
IDRF:掩码离散扩散模型的逆蒸馏奖励微调
IDRF: Inverse-Distilled Reward Fine-tuning of Masked Discrete Diffusion Models
摘要
掩码离散扩散模型为自回归生成提供了有前途的替代,但迭代采样可能昂贵,且不可处理的序列似然使奖励微调复杂化。我们提出IDRF——少步掩码离散扩散生成器奖励微调的框架:从标准反向KL正则目标出发,IDRF用逆蒸馏正则替代不可处理的序列级KL惩罚;在最优辅助去噪器下我们证明总体逆蒸馏损失上界了到参照分布的序列级KL散度。IDRF优化该损失的基于轨迹的替代而无需参照模型rollout,学生保留自己的少步采样器;我们把少步生成视为有限地平线马尔可夫决策过程,在学生轨迹上以裁剪策略梯度目标优化奖励。跨DNA、图像与文本生成,IDRF以最多32倍少于参照的去噪步数取得高奖励,同时缓解奖励黑客并保持样本质量。