论文

HPSv3++:在扩散模型功能的整个范围内扩展奖励模型

HPSv3++: Scaling Reward Models Across the Full Spectrum of Diffusion Model Capabilities

模型训练奖励建模与过程监督

摘要

奖励模型引导文本到图像(T2I)系统朝着符合人类偏好的输出方向发展。然而,诸如 HPSv3 之类的典型奖励模型是根据早期 T2I 模型的预注释数据进行训练的,没有考虑到不断发展的模型功能和强化学习 (RL) 迭代所引起的质量判别变化,从而限制了其更广泛的适用性。在这项工作中,我们提出了 HPSv3++,这是一种奖励模型框架,它针对不同的 T2I 模型功能及其在整个能力迭代范围内的 RL 迭代变化提升了 HPSv3 模型。具体来说,我们首先引入 HPDv3++,这是一个 212K 二维偏好数据集,使用最新的高性能(Qwen-Image)模型在人工监督下注释文本保真度和美学质量。然后我们提出一个两阶段的训练框架。第一阶段采用数据感知正交梯度投影来融合 HPDv3++ 的不同审美感知,同时保留 HPSv3 中原始有效的人类偏好知识。第 2 阶段进一步利用来自跨越不同能力级别和 RL 迭代的 T2I 模型的未标记数据,并为奖励模型引入联合能力迭代条件信号以及标准差驱动的无监督指导机制,从而加强了整个能力迭代范围内的奖励模型。 HPSv3++ 实现了最先进的偏好预测,在 HPDv3 上优于 HPSv3 9.8%,在 GenAI-Bench 上优于 HPSv3 5.5%,同时在我们提出的 HPDv3++ 上实现 79.1%/88.1%。当用于 T2I RL 训练时,它可以持续提高不同 T2I 模型的 GenEval 分数,展示了其广泛的功能。该代码可从 https://github.com/PlantPotatoOnMoon/HPSv3-PlusPlus 获取。