论文

AdvantageFlow:流模型中的正则化 Advantage 加权 RL

AdvantageFlow: Regularized Advantage-Weighted RL in Flow Models

模型训练强化学习

摘要

我们提出 AdvantageFlow,一种用于修正流模型的前向过程强化学习 (RL) 算法。该算法最小化优势加权预测损失,最大化奖励,通过轨迹采样策略进行正则化,凸化目标并使其优化稳定。我们的目标可以被视为拟合局部奖励改善目标分布。轨迹采样正则化作为方差减少步骤出现。我们使用 Stable Diffusion 3.5 Medium 和 FLUX.1 对 AdvantageFlow 的文本到图像生成进行了实证评估,并将其与正向和反向过程 RL 算法进行比较。