论文
DiT-Reward:文本到图像奖励建模的生成表示
DiT-Reward: Generative Representations for Text-to-Image Reward Modeling
摘要
为图像生成学习的表示也可以支持生成图像的评估吗?我们研究文本到图像奖励预测作为生成表示学习的下游任务。为此,我们引入了 DiT-Reward,它通过处理近乎干净的图像潜伏并聚合 Transformer 层上的文本条件图像表示,将预训练的文本到图像扩散 Transformer 转换为奖励模型。在与 HPSv3 相同的训练数据混合下,DiT-Reward 在所有四个评估偏好基准上均优于 HPSv3,在 HPDv2 上达到 85.6%,在 HPDv3 上达到 77.6%。当生成主干被冻结时,轻量级学习头仍然可以从其表示中提取有意义的偏好预测。深度探索进一步揭示,下游奖励表现在中后期层最强,并且可以从不同阶段的表示组合中受益。我们还观察到骨干生成能力的持续正向扩展。最后,当使用 Flow-GRPO 优化 Stable Diffusion 3.5 Large 时,DiT-Reward 在匹配的训练轨迹上优于 HPSv3,在真实感方面有特别明显的提升。与具有相当峰值内存的 HPSv3 相比,直接潜在评分还实现了 1.65 倍的推理加速。这些结果表明,预训练的生成 DiT 为奖励建模和策略优化提供了可转移的表示。