论文
精确:流匹配模型的 RL 后训练 的 SDE 一致随机采样
Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models
摘要
强化学习(RL)已成为提高扩散和流匹配生成器的即时对齐和感知质量的有效方法。将在线强化学习应用于流匹配的关键步骤是将确定性采样轨迹转变为随机策略,通常是将反时常微分方程 (ODE) 替换为随机微分方程 (SDE)。因此,控制探索行为和去噪动态的随机采样器是策略的一部分,其设计可以显着影响奖励优化性能。我们将采样器设计分解为两个相互依赖的部分:选择适量的随机探索,并以 RL 中使用的小步数忠实地离散化生成的 SDE。为了解决第一个组成部分,我们分析了去噪中探索和稳定性之间的内在张力,并得出了平衡两者的 SDE 时间表。谈到离散化挑战,我们使用一个玩具示例来表明现有采样器可能会偏离流匹配过程,要么引入过多的离散化噪声,要么依赖不能保证收敛到数据分布的启发式规则。为了解决这些问题,我们提出了 Precise,一种新的随机采样器,可以平衡有效探索与稳定性。至关重要的是,Precise 通过一种新颖的近似来保持去噪轨迹 SDE 一致,该近似冻结了干净的潜在后验均值,解决了标准采样器中的过多噪声问题。大量实验表明,该公式通过强化学习实现显着更快、更稳定的奖励优化,实现最先进的对齐分数(例如,PickScore、HPSv2.1),同时需要减少 13.1-53.2% 的挂钟训练时间来匹配先前采样器的最佳域内性能。