论文

AdaGRPO:基于流的 GRPO 的能力感知自适应增强

AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO

模型训练强化学习

摘要

组相对策略优化 (GRPO) 在使文本到图像 (T2I) 流模型与人类偏好保持一致方面取得了显着的成功。然而,我们发现当前基于流程的 GRPO 的学习循环从根本上与学习者的当前能力脱钩,在提示选择和优势估计方面都存在关键盲点:(i)现有方法随机采样提示,忽视了数据选择对强化学习(RL)功效的实质性影响——事实证明,大语言模型 的 GRPO 中这一因素至关重要; (ii) 仅依靠组内统计数据评估样本质量,缺乏全球视角来准确衡量真正的政策改善。为了解决这些问题,我们提出了自适应 GRPO (AdaGRPO),这是一种专为流模型量身定制的新型能力感知 RL 算法。具体来说,AdaGRPO由两个主要组成部分组成:(i)在线课程过滤策略:动态跟踪模型的熟练程度并自适应地选择最适合其当前学习边界的提示; (ii)跨层次优势融合:将细粒度的集团内优势与宏观的全球优势协同融合,提供全面、公正的政策评估。作为轻量级、即插即用的模块,AdaGRPO 可以与 Flow-GRPO、DanceGRPO 和 Flow-CPS 等现有框架无缝集成。大量实验表明,AdaGRPO 能够持续推动性能提升,同时显着稳定流模型的 GRPO 训练。