论文

OP-GRPO:适用于流量匹配模型的高效 离策略 GRPO

OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models

模型训练强化学习

摘要

通过 GRPO 的 后训练 在提高流匹配模型的生成质量方面表现出了显着的效果。然而,GRPO 由于其 同策略 训练范例而存在固有的低样本效率。为了解决这个限制,我们提出了 OP-GRPO,这是第一个专为流量匹配模型量身定制的 离策略 GRPO 框架。首先,我们主动选择高质量的轨迹,并将它们自适应地合并到重放缓冲区中,以便在后续训练迭代中重用。其次,为了减轻 离策略 样本引入的分布偏移,我们提出了一种序列级重要性采样校正,可以保留 GRPO 裁剪机制的完整性,同时确保稳定的策略更新。第三,我们从理论上和经验上表明,后期去噪步骤会产生病态的 离策略 比率,并通过在后期步骤截断轨迹来缓解这种情况。在图像和视频生成基准中,OP-GRPO 平均只需 34.2% 的训练步骤即可实现与 Flow-GRPO 相当或更好的性能,在保持生成质量的同时显着提高训练效率。