论文
RubricRM:通过动态 Rubrics 进行图像生成和编辑的生成奖励建模
RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing
摘要
奖励模型在调整视觉生成模型方面发挥着重要作用,但大多数现有的视觉奖励模型使用单一标量分数或依赖于无法适应不同指令的固定标准。这限制了可解释性和任务敏感性,特别是对于文本到图像生成和基于指令的图像编辑,其中不同的输入需要不同的评估维度。我们提出了 RubricRM,一种成对生成奖励建模框架,它首先生成具有评估维度、权重和评分标准的特定于输入的评分标准,然后应用该评分标准对候选图像进行评分。我们使用两阶段训练管道来训练用于文本到图像生成和图像编辑的专用 RubricRM 模型:监督 微调 向模型传授基于 rubric 的评分范式,而 GRPO 通过细粒度的维度级别奖励进一步提高评分。对多个生成和编辑基准的实验表明,RubricRM 的性能优于现有的专门奖励模型,并且尽管使用较小的骨干网,但仍与强大的专有 MLLM 法官保持竞争力。我们的模型、数据和代码可在 https://github.com/zijiankan/RubricRM 获取。