论文
强化伴随匹配:扩散和流动匹配模型的缩放 RL 后训练
Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models
摘要
扩散和流量匹配模型可以扩展,因为预训练是有监督的回归:干净的样本经过分析噪声处理,模型针对封闭形式的目标进行回归。 RL 后训练 使模型与奖励保持一致。在图像生成中,这使得样本能够正确地组合对象、清晰地渲染文本并符合人类的偏好。现有方法依赖于成本高昂的 SDE 部署、奖励梯度或替代损失,从而牺牲了预训练的回归结构。我们证明该结构扩展到 RL 后训练。在 KL 正则奖励最大化下,最优生成过程使干净端点分布向具有更高奖励的样本倾斜,并保持噪声定律不变。将此与伴随匹配最优性条件和 REINFORCE 身份相结合,我们得出强化伴随匹配(RAM):用奖励纠正预训练目标的一致性损失。在每一步中,我们都会从当前模型中得出一个干净的端点,评估其奖励,像预训练一样对其进行噪声处理,然后进行回归。不需要 SDE 采样轨迹、向后伴随扫描或奖励梯度。与预训练目标一样,RAM 很简单且可扩展。在 Stable Diffusion 3.5M 上,RAM 在可组合性、文本渲染和人类偏好方面获得了最高奖励,以最多 $50\times$ 的训练步骤达到 Flow-GRPO 的最高奖励。