论文

流匹配模型上 GRPO 的逐步奖励归因

Stepwise Credit Assignment for GRPO on Flow-Matching Models

模型训练强化学习

摘要

Flow-GRPO 成功地将强化学习应用于流模型,但在所有步骤中使用统一的奖励归因。这忽略了扩散生成的时间结构:早期步骤决定成分和内容(低频结构),而后期步骤解决细节和纹理(高频细节)。此外,仅根据最终图像分配统一的奖励贡献可能会无意中奖励次优的中间步骤,特别是当稍后在扩散轨迹中纠正错误时。我们提出了Stepwise-Flow-GRPO,它根据每一步的奖励改进来分配信用。通过利用 Tweedie 公式获得中间奖励估计并引入基于增益的优势,我们的方法实现了卓越的样本效率和更快的收敛。我们还引入了受 DDIM 启发的 SDE,它可以提高奖励质量,同时保持策略梯度的随机性。