论文

MEND:通过近端速度匹配用于流动模型的强化学习

MEND: RL For Flow Models via Proximal Velocity Matching

模型训练强化学习

摘要

流模型的奖励后训练要么在 KL 惩罚或冻结参考下重新加权模型自己的样本,通常用于数千次更新,要么反向传播奖励并移动每个样本,而不检查移动是否值得其大小。我们介绍 MEND,一种基于近端速度匹配的强化学习方法。 MEND 限制了每个提示组内的奖励,因此已经得分良好的样本不会受到任何移动。在上限之下,它建议沿奖励梯度移动,并且仅当其上限奖励增益超过二次位移价格时才接受。然后,模型回归到生成的速度目标,没有 KL 项、冻结参考模型或优势权重。在 100 次更新中,在与基本模型图像的距离相同的情况下,MEND 在 6 个评估器中的 5 个上优于 Flow-GRPO(大约 4k 次更新)。在等预算协议下,它在四个训练奖励的每次评估更新中都超过了 ReFL 和 DiffusionNFT,分别达到 PickScore 24.03、23.92 和 23.43。 300 次更新的三奖励运行在其训练的所有三个奖励上也超过了五奖励 DiffusionNFT 模型。 MEND 具有通用性且易于采用:它适用于任何具有可微奖励的流程骨干模型。

MEND:通过近端速度匹配用于流动模型的强化学习的原论文方法或结果图
图 4:MEND 概述。 (1)一组提示符$c$;样品保留在盖子 $\kappa$ 处或上方。 (2) 低于上限的每个样本都会获得 3 个提案,其奖励为梯度;判决从上限奖励中减去距离价格并保留最佳候选者,这里是最短的移动 $y_{1}$。 (3) 经过训练的适配器在存储的状态下回归到行为预测加上接受的位移 $d$,即方程 5 的速度目标;然后行为模型遵循 EMA。