论文
DyCoRM:用于文本到图像生成的动态标准感知奖励建模
DyCoRM: Dynamic Criterion-Aware Reward Modeling for Text-to-Image Generation
摘要
随着文本到图像(T2I)生成技术的不断进步,生成高质量图像变得越来越容易;因此,用户的需求正在转向更能满足其特定要求的图像。由于奖励模型在评估生成的图像是否符合用户偏好方面发挥着越来越重要的作用,这种趋势给奖励建模带来了一个重要的挑战:奖励模型不应仅仅依赖于静态和一般的评估维度,而应考虑与任务相关的细粒度标准,用户可以通过这些标准来评估生成的图像是否满足其特定要求。为了应对这一挑战,我们提出了 DyCoRM,这是一种动态的、标准感知的奖励模型,它基于任务相关标准并执行标准感知的偏好比较。为了支持这种设置,我们构建了 DyCoDataset-20K,它提供了动态标准和标准级注释,并进一步派生了 DyCoBench-1K,这是在动态标准下系统评估奖励模型的基准。我们进一步介绍 DyCoPick,它应用标准感知奖励模型来选择 T2I 图像。我们的贡献建立了第一个奖励建模框架,用于 T2I 生成中的动态和细粒度评估和实际应用。