论文
Flow-DPPO:流匹配模型的发散近端策略优化
Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models
摘要
最近的工作表明,在线强化学习(RL)可以显着提高图像和视频生成的流匹配模型的质量和对齐。 Flow-GRPO 和 CPS 等方法将去噪过程视为马尔可夫决策过程,并应用 PPO 式比率裁剪来强制信任区域。然而,我们认为比率裁剪在结构上不适合流量模型:新旧政策之间的概率比是对真实政策分歧的嘈杂的单样本估计,导致轨迹的某些区域过度约束而其他区域约束不足。我们提出 Flow-DPPO(流发散近端策略优化),它用发散近端约束代替比率裁剪。一个关键的观察结果是,流模型中的每步策略是高斯分布,从而能够准确且廉价地计算新旧策略之间的 KL 散度。 Flow-DPPO 采用非对称发散掩模,仅当梯度更新同时远离可信区域并违反发散阈值时才阻止梯度更新。实验表明,Flow-DPPO 以更好的 KL 近端效率实现了更高的奖励,减轻了灾难性遗忘,促进平衡的多目标优化,并在比率裁剪降低的情况下实现稳定的多时期训练。代码和模型可在 https://github.com/Tencent-Hunyuan/UniRL/tree/main/FlowDPPO 获取。