论文

UniGRPO:统一优化交错文本与图像生成

UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation

模型训练强化学习

摘要

能够交错生成的统一模型已成为一种有前途的范例,随着社区越来越多地关注用于文本的自回归建模和用于图像生成的流匹配。为了推进这个方向,我们提出了一个为交错生成量身定制的统一强化学习框架。我们在其基本单元上验证了我们的方法:单轮推理驱动的图像生成,其中模型首先通过推理扩展用户提示,然后进行图像合成。将这种多模态生成过程表述为具有稀疏终端奖励的马尔可夫决策过程,我们引入 UniGRPO 来使用 GRPO 联合优化文本和图像生成策略。我们采用极简主义方法来避免过度设计,通过无缝集成用于推理的标准 GRPO 和用于视觉合成的 FlowGRPO,利用两种模式的既定训练方案。为了确保多轮交错生成的可扩展性,我们对原始 FlowGRPO 进行了两项关键修改:(1)消除无分类器引导以维持线性、无分支的采样轨迹,这对于扩展到涉及多轮交互和多条件生成(例如编辑)的复杂场景至关重要; (2) 用直接在速度场上的 MSE 惩罚代替标准的潜在 KL 惩罚,提供更稳健和直接的正则化信号以有效缓解 奖励作弊。我们的实验表明,这种统一的训练方法通过推理显着提高了图像生成质量,为未来的完全交错模型 后训练 提供了强大且可扩展的基线。