论文
AlphaGRPO:通过分解可验证奖励解锁 UMM 中的自反射多模态生成
AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward
摘要
在本文中,我们提出了 AlphaGRPO,这是一种新颖的框架,它将组相对策略优化 (GRPO) 应用于 AR-扩散统一多模态模型 (UMM),以增强多模态生成能力,而无需额外的冷启动阶段。我们的方法释放了模型执行高级推理任务的内在潜力:推理文本到图像生成,其中模型主动推断隐式用户意图,以及自我反思细化,其中它自动诊断和纠正生成输出中的偏差。为了解决为现实世界的多模式生成提供稳定监督的挑战,我们引入了分解可验证奖励(DVReward)。与整体标量奖励不同,DVReward 利用 LLM 将复杂的用户请求分解为原子的、可验证的语义和质量问题,然后由通用 MLLM 进行评估,以提供可靠且可解释的反馈。大量实验表明,AlphaGRPO 在多模态生成基准测试(包括 GenEval、TIIF-Bench、DPG-Bench 和 WISE)上取得了稳健的改进,同时在 GEdit 上的编辑任务上也取得了显着的进步,而无需进行编辑任务训练。这些结果验证了我们的自我反思强化方法有效地利用了固有的理解来指导高保真生成。项目页面:https://huangrh99.github.io/AlphaGRPO/