论文
MEND:通过近端速度匹配用于流动模型的强化学习
MEND: RL For Flow Models via Proximal Velocity Matching
摘要
流模型的奖励后训练要么在 KL 惩罚或冻结参考下重新加权模型自己的样本,通常用于数千次更新,要么反向传播奖励并移动每个样本,而不检查移动是否值得其大小。我们介绍 MEND,一种基于近端速度匹配的强化学习方法。 MEND 限制了每个提示组内的奖励,因此已经得分良好的样本不会受到任何移动。在上限之下,它建议沿奖励梯度移动,并且仅当其上限奖励增益超过二次位移价格时才接受。然后,模型回归到生成的速度目标,没有 KL 项、冻结参考模型或优势权重。在 100 次更新中,在与基本模型图像的距离相同的情况下,MEND 在 6 个评估器中的 5 个上优于 Flow-GRPO(大约 4k 次更新)。在等预算协议下,它在四个训练奖励的每次评估更新中都超过了 ReFL 和 DiffusionNFT,分别达到 PickScore 24.03、23.92 和 23.43。 300 次更新的三奖励运行在其训练的所有三个奖励上也超过了五奖励 DiffusionNFT 模型。 MEND 具有通用性且易于采用:它适用于任何具有可微奖励的流程骨干模型。
