论文
奖励一直就在您的数据中:使用判别器引导的 RL 纠正流量匹配
The Reward Was in Your Data All Along: Correcting Flow Matching with Discriminator-Guided RL
摘要
得分匹配和流匹配模型通常依赖基于偏好的强化学习来达到两个目的:与主观偏好保持一致,以及令人惊讶的是恢复基于匹配的训练旨在从数据本身中学习的属性,例如视觉真实感和连贯的对象结构。我们认为这反映了结构性不匹配。匹配损失测量训练时间边缘下速度或得分场的 $\ell_2$ 回归误差,该代理与决定推理时样本质量的视觉和语义属性不太一致。给定与这些属性一致的奖励,强化学习通过在自己的样本上评估模型并直接遵循奖励环境来避免不匹配。面临的挑战是在不依赖人类偏好的情况下获得这样的奖励,人类偏好成本高昂,并且将数据现实主义与注释者倾向混为一谈。我们提出判别器引导的强化学习(DRL)。 DRL 训练一个判别器,将数据从预训练表示空间中的基本模型样本中分离出来,并使用其 logits 作为 KL 正则化 RL 中的奖励。预训练空间将鉴别器限制在感知上有意义的方向,logits 估计数据和模型之间的对数似然比,这是针对数据分布的最佳奖励。在 SiT、JiT、REPA 和 RAE 中,DRL 减少了无引导 FID(例如,SiT 上的 9.38到 2.62)和语义空间 FD(例如,SiT 的 DINOv3 上 88.2到 19.3),在所有骨干网中获得一致的收益,并且无需对其进行训练即可提高人类偏好奖励。它还在随后基于偏好的 后训练 下在偏好奖励和图像保真度之间产生了更好的帕累托边界,增加了对齐,同时减少了底层视觉伪影,例如过饱和和过度亮度。