论文
FlowAWR:通过优势加权校正进行在线自适应流模型强化学习
FlowAWR: Online Adaptive Flow Reinforcement via Advantage-Weighted Rectification
摘要
通过在线强化学习在连续空间上对齐生成流模型受到棘手的轨迹可能性的限制。现有的密度近似策略梯度方法依赖于随机 SDE 采样器来构建易于处理的转换内核,这会引入训练推理不一致并需要无分类器指导(CFG)。虽然 DiffusionNFT 等隐式框架直接优化前向过程速度场,但其启发式固定幅度校正阻止了相对组内质量的优化强度。我们提出 \textit{Flow Advantage-Weighted Rectification} (\textbf{FlowAWR}),一种将连续生成策略优化重塑为朝向理论上最优速度场的监督回归的范例。从 KL 约束奖励最大化的最优策略开始,FlowAWR 推导了最优速度场,该速度场允许幅度感知、优势加权修正形式,从而产生无 SDE 优化和无 CFG 生成。在 SD3.5-Medium 的比较评估中,FlowAWR 实现了改进的对齐性能,同时比 DiffusionNFT 具有 2$\times$ 到 5$\times$ 的收敛加速(例如,在 1.2k 步中达到 24.12 PickScore,而 DiffusionNFT 在 2.0k 步中达到 23.82,FlowGRPO 在 $>$4k 步中达到 23.50)。在多重奖励约束下,FlowAWR 维持生成质量,满足结构规则,同时保持稳定的域外性能。