论文
RationalRewards:推理奖励在训练时与测试时共同扩展视觉生成
RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time
摘要
多数面向视觉生成的奖励模型把丰富的人类判断压缩为单一无解释的分数,丢弃了偏好背后的推理。我们证明,教会奖励模型在打分前产出显式的多维批评,能将其从被动评估器转变为主动优化工具,以两种互补方式改进生成器:在训练时,结构化理由为强化学习提供可解释的细粒度奖励;在测试时,生成-批评-精炼(Generate-Critique-Refine)循环把批评转化为有针对性的提示词修订,无需任何参数更新即可改进输出。为了在不依赖昂贵理由标注的情况下训练这样的奖励模型,我们提出Preference-Anchored Rationalization(PARROT),一个规范化的框架,通过锚定生成、一致性过滤和蒸馏,从现成可得的偏好数据中恢复高质量理由。由此得到的模型RationalRewards(8B)在开源奖励模型中取得最先进的偏好预测性能,与Gemini-2.5-Pro相当,而训练数据比同类基线少10-20倍。作为RL奖励,它对文生图与图像编辑生成器的改进持续优于标量奖励替代方案。最引人注目的是,其测试时批评-精炼循环在若干基准上媲美甚至超过基于RL的微调,表明结构化推理能够释放现有生成器中被欠佳提示词所掩盖的潜在能力。
