论文
设计扩散模型的强化学习:统一的路径空间视图
Designing Reinforcement Learning for Diffusion Models: A Unified Path-Space View
摘要
强化学习 (RL) 后训练 提供了一种直接方法,使扩散模型与人类偏好和特定任务奖励保持一致。然而,当前用于扩散模型的强化学习算法仍然支离破碎:反向轨迹方法依赖于离散似然比,而前向匹配方法则在 rollout 样本的奖励标记噪声版本上进行训练。本文表明,这些看似不同的损失源于单一路径空间原理。从正则化扩散强化学习目标开始,我们使用采样 SDE 之间的重要性采样来获得轨迹空间上的显式策略梯度估计器。估计器包含 Flow-GRPO 类型更新的随机 Itô 积分;我们推导了一个等效的方差减少值梯度形式,它恢复了 AWM 和 DiffusionNFT 的前向匹配结构。这将这些方法族之间的经验差距确定为方差减少效应,而不是强化学习原理的差异。该推导产生了由值梯度估计、权重函数和采样选择组织的统一设计空间。在这个空间内,我们提出了一个多样本 KDE 值梯度估计器,它重用了 rollout 组,以及保留稳定的现有配方但排除单一配方的规模限制权重系列。 SD3.5-M 和 Qwen-Image 模型上的实验验证了方差减少的解释,并表明所得配方比之前的扩散 RL 基线有所改进。