论文

dFlowGRPO:离散流模型的速率感知策略优化

dFlowGRPO: Rate-Aware Policy Optimization for Discrete Flow Models

模型训练强化学习

摘要

离散流模型 (DFM) 是一类用于生成离散数据的灵活生成模型,扩散 大语言模型 (dLLM) 可以被视为具有混合路径和屏蔽源分布的特定选择的特殊情况。虽然最近的几项工作已经探索了 dLLM 的强化学习,但其在更一般的离散流模型中的应用仍未得到充分探索。在这项工作中,我们提出了离散流GRPO(dFlowGRPO),这是一种用于离散流模型的统一强化学习框架,支持广泛的概率路径和非屏蔽源分布。我们推导了 DFM 的完整轨迹概率,并将去噪过程表述为马尔可夫决策过程,使 dFlowGRPO 能够在强化学习期间合并来自相关条件转移率和后验模型的信息。我们将 dFlowGRPO 应用于 FUDOKI(一种最新的多模态离散流模型),并在图像生成和多模态理解任务上对其进行评估。实证结果表明,dFlowGRPO 在文本到图像生成任务上优于 dLLM 的现有 GRPO 类型方法,并实现了与使用 Flow-GRPO 训练的基于连续流的模型相媲美的性能,同时还展示了理解任务的强大能力。