论文

UDM-GRPO:均匀离散扩散模型的稳定高效的群体相对策略优化

UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models

模型训练强化学习

摘要

均匀离散扩散模型(UDM)最近已成为离散生成建模的一个有前途的范例;然而,它与强化学习的整合在很大程度上仍未得到探索。我们观察到,天真地将 GRPO 应用于 UDM 会导致训练不稳定和边际性能提升。为了解决这个问题,我们提出了 UDM-GRPO,这是第一个将 UDM 与 RL 集成的框架。我们的方法以两个关键见解为指导:(i)将最终的干净样本视为提供更准确和稳定的优化信号的操作; (ii) 通过扩散前向过程重建轨迹可以更好地将概率路径与预训练分布对齐。此外,我们引入了两种策略,Reduced-Step 和 CFG-Free,以进一步提高训练效率。 UDM-GRPO 显着提高了跨多个 T2I 任务的基本模型性能。值得注意的是,GenEval 准确度从 $69\%$ 提高到 $96\%$,PickScore 从 $20.46$ 提高到 $23.81$,在连续和离散设置中实现了最先进的性能。在 OCR 基准上,准确率从 $8\%$ 上升到 $57\%$,进一步验证了我们方法的泛化能力。代码可在 https://github.com/Yovecent/UDM-GRPO 获取。