论文
回顾一下:预训练的 MLLM 是用于文本到图像生成的零样本奖励模型
Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
摘要
在本文中,我们提出了 SpectraReward,这是一种 无需训练 奖励函数,可将预训练的 MLLM 转变为用于图像生成强化学习的现成奖励模型。 SpectraReward 不是要求 MLLM 判断生成的图像或回答分解的验证问题,而是衡量通过单个图像调节的、教师强制的前向传递从生成的图像中恢复原始提示的效果。我们使用平均图像条件提示对数似然作为奖励,直接重用 MLLM 的预训练图像文本对齐能力,无需偏好标签,奖励模型 微调。我们进一步引入了Self-SpectraReward,这是统一多模态模型的一个特例,其中策略自身的理解分支作为其生成分支的奖励模型,形成一个闭环的自我改进框架,无需外部奖励模型或外部知识。大量实验通过广泛的图像生成 RL 研究验证了 SpectraReward,该研究涵盖两个扩散模型、三种 RL 算法、来自四个 MLLM 系列(涵盖 4B 到 235B 参数)的九个奖励 MLLM 主干,以及五个分布外文本到图像基准。结果表明,SpectraReward 和 Self-SpectraReward 均显着且持续地提高了生成性能,并且优于先前的 MLLM 派生奖励训练方法。进一步的分析表明,较大的奖励 MLLM 并不总是更好,而 Self-SpectraReward 可以匹配或超越更大的外部奖励模型,这表明奖励政策对齐是有效图像生成 RL 的关键因素。项目页面:https://huangrh99.github.io/SpectraReward/