论文

AutoRubric-T2I:用于文生图对齐的稳健规则型奖励模型

AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment

模型训练奖励建模与过程监督

摘要

使文生图(T2I)生成模型与人类偏好对齐,越来越依赖图像奖励模型,即依据提示对齐度与感知质量为生成图像打分或排序的模型。现有奖励模型通常作为Bradley-Terry(BT)偏好模型在大规模人类偏好语料上训练,因而训练成本高、难以适配,且评估标准不透明。与此同时,视觉语言模型(VLM)裁判可以通过文本评分细则提供更细粒度的评估,但其手工设计或启发式生成的评分规则可能无法可靠地反映人类偏好。本文提出AutoRubric-T2I,这是T2I领域首个评分细则学习框架,可自动合成并筛选用于指导VLM裁判的显式评分细则。AutoRubric-T2I首先将偏好对中的推理轨迹合成为候选评分细则,然后使用VLM裁判在每个评分细则下为成对图像打分,产生用于偏好学习的成对评分细则得分差。为去除噪声与冗余规则,我们进一步采用ℓ1正则化逻辑回归精炼器,选出最具区分力的Top-N条评分细则。大量评估表明,AutoRubric-T2I仅使用不到0.01%的标注偏好数据即可产生高质量、可解释的奖励信号,大幅降低了对大规模奖励模型训练的需求。在MMRB2等图像奖励基准上,AutoRubric-T2I优于强大的奖励模型基线。我们进一步将AutoRubric-T2I作为强化学习奖励在下游T2I任务上加以验证,包括TIIF与UniGenBench++,在扩散模型上使用Flow-GRPO流水线时,其生成质量优于标量奖励模型。

AutoRubric-T2I:用于文生图对齐的稳健规则型奖励模型:论文配图
图1:标量奖励优化中的奖励劫持:HPSv3获得高标量奖励却违反提示特定约束,AutoRubric-T2I则偏好符合量规的对齐生成。