论文

通过速度匹配扩展扩散模型的强化学习

Scaling Reinforcement Learning for Diffusion Models via Velocity Matching

模型训练强化学习

摘要

基于奖励的 微调 扩散模型很大程度上继承了为自回归 大语言模型 (LLM) 开发的基于可能性的策略优化。然而,扩散模型是通过速度回归进行本地训练的,并且不直接提供生成样本的可能性。现有方法使用沿着随机去噪轨迹的转移可能性或证据下界(ELBO)来近似生成样本的可能性来解决这个问题。这些近似值是通过将基于可能性的更新应用于通过速度场进行本机训练和生成的模型而产生的。相反,我们将速度匹配作为奖励 微调 的起点。我们提出 \textbf{基于奖励的速度匹配(RVM)},它通过奖励和附加锚回归项对速度匹配损失进行加权,既不需要似然估计也不需要似然比。 RVM 在更新级别恢复了强化伴随匹配,并包含 DiffusionNFT 作为特例,而基于 ELBO 的方法通过相同的速度回归结构密切相关。这种统一的视图将奖励设计和锚定速度分离为基于速度的 微调 中的主要设计选择。在文本到图像、文本到视频和图像到视频生成方面,RVM 匹配或优于评估的基于轨迹的方法。在 Wan2.1-T2V-1.3B 上,它在评估的方法中实现了最高的 VBench 总体评分,并且估计训练成本比基于轨迹的方法低得多。对于视频 微调,我们引入了动态跟踪奖励,可提供明确的运动反馈并提高动态度和整体 VBench 性能。