论文
MeanFlowNFT:将前向过程强化学习引入平均速度生成器
MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators
摘要
MeanFlow 生成器通过预测时间间隔内的平均速度来实现快速的几步采样,这使得它们对于高效生成具有吸引力。强化学习 (RL) 已成为将扩散和流动模型与人类偏好和特定任务目标结合起来的强大方法。特别是,DiffusionNFT 提供了一种高效的前向过程 RL 框架,不需要逆向过程轨迹或似然估计。然而,将此类 RL 方法应用于 MeanFlow 的探索仍未充分。 DiffusionNFT 优化瞬时速度,而 MeanFlow 以平均速度采样。为了弥补这一差距,我们引入了 MeanFlowNFT。受到连接平均速度和瞬时速度的 MeanFlow 恒等式的启发,我们构建了诱导瞬时速度预测器。我们将 DiffusionNFT 目标应用于该预测器,为 MeanFlow 明确定义了奖励优化。采样仍然基于平均速度,保留了 MeanFlow 的快速几步生成。我们进一步证明MeanFlowNFT继承了DiffusionNFT严格的策略改进保证。图像和视频生成实验表明,MeanFlowNFT 持续改进基线。此外,它在大多数指标上都优于先前最先进的 RL 调整的少步生成器(SD3.5-M 上的 8 项指标中的 6 项),甚至可以在仅使用几个采样步骤的情况下超越多步 RL 调整的扩散。例如,在 Wan 2.1 上,4 步的 MeanFlowNFT 的 VBench 得分为 84.33,超过了 50 步的 LongCat-Video RL(82.57)。