论文
LC-GRPO:通过 Langevin 校正弥合基于流的 GRPO 的训练推理差距
LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction
摘要
基于流的生成模型通常通过求解确定性常微分方程 (ODE) 进行采样,而在线强化学习则需要随机采样轨迹来进行策略探索和优化。因此,现有的流模型 GRPO 方法在训练期间用随机微分方程 (SDE) 取代了推理时间 ODE。尽管 ODE 和 SDE 在连续时间内具有相同的边际分布,但它们的有限步离散化可能存在很大差异。特别是,随着探索噪声的增加,SDE采样轨迹通常会变得模糊,从而导致用于强化学习的样本与测试时 ODE 采样器生成的样本之间不匹配。我们引入了 LC-GRPO,这是一种基于流的 GRPO 框架,具有 Langevin 校正功能。每个采样轨迹中的状态转移首先采用推理对齐的 ODE 欧拉步骤,然后应用针对结果时间步的边缘分布的随机 Langevin 校正。所需的分数直接从流速中恢复,不需要额外的分数模型,而所得的转变仍然是各向同性高斯分布,具有易于处理的策略优化可能性。我们从理论上证明,在适当的条件下,一个 Langevin 校正步骤可以减少不完美 ODE Euler 步骤的 Wasserstein 误差。在匹配的随机性水平上,我们进一步表明所提出的转换比反向 SDE 的标准 Euler-Maruyama 离散化更准确。 SD3.5-Medium、FLUX.1-Dev 和 HunyuanVideo 上的实验表明,LC-GRPO 持续改进了文本到图像和文本到视频任务的奖励优化,保持了生成质量,并大大缩小了随机训练采样轨迹和确定性测试时 ODE 推理之间的差距。