论文
课程组策略优化:自适应采样释放文本到图像生成的潜力
Curriculum Group Policy Optimization: Adaptive Sampling for Unleashing the Potential of Text-to-Image Generation
摘要
文本到图像(T2I)生成近年来取得了显着的进展。与此同时,强化学习方法,特别是基于组相对策略优化(GRPO)的方法,引起了广泛的关注并成功应用于T2I任务。然而,训练时常用的均匀采样策略往往忽略了样本难度与模型当前学习能力的匹配,导致训练效率低下。我们认为,提高训练效率需要不断优先考虑与模型不断发展的能力相匹配并保持主动可学习性的提示。为此,我们提出了课程组策略优化(CGPO),一种自适应课程训练框架。在训练期间,每个提示都会生成一组由奖励模型评分的图像。我们使用群体奖励的方差作为在线代理来提示不一致。较高的方差表明模型已经部分捕获了提示要求,但尚未实现稳定的掌握。这样的提示更有可能提供有用的学习信号,因此我们相应地增加它们的采样概率。此外,为了解决多类别数据集中的数据不平衡问题,我们设计了一种基于比例公平优化的类别校准方法,平衡了跨类别的训练难度。 GenEval、T2I-CompBench++ 和 DPG Bench 上的实验表明,我们的框架有效提高了生成性能。