论文

得分前思考:视觉生成的思考奖励模型

Think Before You Score: Thinking Reward Model for Visual Generation

模型训练奖励建模与过程监督

摘要

视觉奖励模型对于评估和改进视觉生成模型至关重要,但现有方法通常将任务条件和候选输出直接映射到标量奖励,从而隐含了每个案例应评估的内容。我们引入了“先思考后评分”,这是一种在判断候选人表现之前明确确定每种情况的重要因素的范式。遵循这一原则,我们提出了思考奖励模型(TRM),该模型制定案例自适应的评分标准,进行评分标准引导的评估,并产生细粒度的逐点奖励。我们进一步观察到传统的成对偏好优化会引起分数极化,并引入成对双组相对策略优化(PD-GRPO),它利用成对监督来改善奖励歧视,同时保留细粒度的逐点评分。关于图像生成和编辑奖励建模基准的大量实验表明,TRM 在开源奖励模型中实现了最先进的性能,同时与专有替代方案保持了高度竞争力。此外,使用TRM作为强化学习的奖励可以持续改进多样化的视觉生成模型,证明其细粒度、案例自适应的奖励可以转化为视觉生成的有效优化信号。

得分前思考:视觉生成的思考奖励模型:图1:思考奖励模型TRM遵循“评分前先思考”范式。给定视觉生成案例,TRM先制定自适应评分规则以明确重要标准,再按规则开展评估并输出最终逐项奖励。这一统一过程在图像生成与编辑奖励建模上取得强劲表现,并有效指导不同视觉生成模型的强化学习。
图1:思考奖励模型TRM遵循“评分前先思考”范式。给定视觉生成案例,TRM先制定自适应评分规则以明确重要标准,再按规则开展评估并输出最终逐项奖励。这一统一过程在图像生成与编辑奖励建模上取得强劲表现,并有效指导不同视觉生成模型的强化学习。