论文

Flow-Map GRPO:通过锚定随机组合进行少步流图生成器的强化学习

Flow-Map GRPO: Reinforcement Learning for Few-Step Flow-Map Generators via Anchored Stochastic Composition

模型训练强化学习

摘要

少步流图生成器(例如一致性模型和 MeanFlow)通过学习噪声和数据之间的远程传输图来加速采样。然而,它们的确定性转变并不直接提供强化学习(RL)后训练 所需的随机轨迹和易处理的似然比。现有的基于 SDE 的随机化技术针对的是基于速度的采样器,并且不直接扩展到远程流图转换。我们提出 Flow-Map GRPO,一个用于确定性少步流图生成器的在线 RL 后训练 框架。其关键组件锚定随机流图合成 (ASFMC) 将确定性传输与基于锚的条件重采样相结合。我们建立了这种构造保留边际概率路径的条件,并为两次和单次流量图开发易于处理的本地和端点锚点策略。这些政策支持统一的 GRPO 训练程序。基于 FLUX 的 MeanFlow 和 sCM 生成器的实验证明了 OCR、PickScore 和 GenEval 在不同数量的推理步骤下的显着改进,包括联合 OCR-PickScore 增益和混合奖励。受控消融表明,随机过渡设计对于将训练奖励转化为生成质量至关重要。 Flow-Map GRPO 可以对预训练的确定性流图生成器进行有效的 RL 对齐,同时保留其原始参数化,而无需将它们重新训练为原生随机模型。