论文

可验证的视觉奖励从合成场景转移到自然提示

Verifiable Visual Rewards Transfer from Synthetic Scenes to Natural Prompts

模型训练奖励建模与过程监督

摘要

图像生成中的精确指令(例如满足对象计数和空间关系)仍然是一个开放的挑战,至少部分原因是它是使用不可靠的奖励模型(例如对象检测器和视觉语言模型)来学习的。我们引入了可验证的视觉奖励(VVR),这是第一个以编程方式验证图像奖励的框架,并表明对其进行训练可以推广到自然提示。每个 VVR 任务都是一个由几何对象及其之间的关系组成的场景,我们从中导出提示和确定性验证器,因此可以以任意数量和任意选定的复杂性生成任务。我们发布了 VVRBench,包含超过 32 种约束类型的 10,000 个任务,以及 VVRBench-Challenge,包含 720 个更复杂的任务;我们评估的最强模型——GPT-Image-2.5——解决了 VVRBench-Challenge 的 21.4%。使用 VVR 分数作为强化学习 (RLVVR) 的奖励,将 VVRBench 上 Stable Diffusion 3.5 Medium 的准确率从 2.8% 提高到 28.3%,并表现出一致的从易到难的泛化能力。这些成果扩展到域外基准,并将 VVR 混合到现有目标中进一步提高整体性能和人类偏好,从而推动将 VVR 纳入标准图像生成后训练配方中。