论文

V-GRPO:去噪生成模型的在线强化学习比您想象的更容易

V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think

模型训练强化学习

摘要

将去噪生成模型与人类偏好或可验证的奖励保持一致仍然是一个关键挑战。虽然策略梯度在线强化学习(RL)提供了有原则的 后训练 框架,但其直接应用受到这些模型棘手的可能性的阻碍。因此,之前的工作要么优化采样轨迹上的诱导马尔可夫决策过程(MDP),这是稳定但效率低下的,要么使用基于扩散证据下界(ELBO)的似然替代,迄今为止在视觉生成方面表现不佳。我们的主要见解是,基于 ELBO 的方法实际上可以变得既稳定又高效。通过减少代理方差和控制梯度步长,我们证明这种方法可以击败基于 MDP 的方法。为此,我们引入了变分 GRPO (V-GRPO),这是一种将基于 ELBO 的代理与组相对策略优化 (GRPO) 算法集成的方法,以及一组简单但重要的技术。我们的方法易于实现,符合预训练目标,并避免了基于 MDP 的方法的局限性。 V-GRPO 在文本到图像合成方面实现了最先进的性能,同时比 MixGRPO 提高了 2 倍的速度,比 DiffusionNFT 的速度提高了 3 倍。