论文
PromptEcho:用于文本到图像强化学习的视觉语言模型的无注释奖励
PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning
摘要
强化学习(RL)可以提高文本到图像(T2I)模型的提示跟随能力,但获得高质量的奖励信号仍然具有挑战性:CLIP Score 太粗粒度,而基于 VLM 的奖励模型(例如 RewardDance)需要昂贵的人工注释偏好数据和额外的 微调。我们提出了 PromptEcho,一种需要 \emph{no} 注释和 \emph{no} 奖励 模型训练 的奖励构造方法。给定生成的图像和引导查询,PromptEcho 计算以原始提示为标签的冻结 VLM 的 词元级 交叉熵损失,直接提取在 VLM 预训练期间编码的图像文本对齐知识。奖励是确定性的、计算效率高的,并且随着更强大的开源 VLM 的出现而自动提高。为了进行评估,我们开发了 DenseAlignBench,这是一个概念丰富的密集图像描述基准,用于严格测试提示跟随能力。两个最先进的 T2I 模型(Z-Image 和 QwenImage-2512)的实验结果表明,PromptEcho 在 DenseAlignBench 上实现了实质性改进(+26.8pp / +16.2pp 净胜率),并且在 GenEval、DPG-Bench 和 TIIFBench 上获得了一致的增益,而无需任何特定于任务的训练。消融研究证实,在相同的 VLM 下,PromptEcho 的性能全面优于基于推理的评分,并且奖励质量与 VLM 大小相关。我们将开源经过训练的模型和 DenseAlignBench。