论文

DRM:具有逐步指导的基于扩散的奖励模型

DRM: Diffusion-based Reward Model With Step-wise Guidance

模型训练奖励建模与过程监督

摘要

当前将扩散模型与人类偏好结合起来的主流方法通常采用基于 VLM 的奖励模型。然而,这些经过语义对齐预先训练的奖励模型很难捕捉基本的感知品质,例如美学、构图和视觉和谐。在这项工作中,我们认为能够高保真生成的模型必须对这些视觉属性有深刻的理解。基于这一见解,我们引入了基于扩散的奖励模型(DRM),这是一种使用预先训练的扩散模型作为强大的评估支柱的新颖范式。 DRM 的一个关键优势是其独特的能力,不仅可以评估最终图像,还可以评估生成过程任何阶段的噪声中间潜伏。我们通过两种方式利用这种逐步评估能力。首先,我们提出了Step-wise GRPO,这是一种强化学习算法,它提供密集的每步奖励,以解决GRPO算法中不精确的贡献分配问题,从而导致更稳定和有效的对齐。其次,我们引入了逐步采样,这是一种新颖的推理策略,它采用 DRM 作为动态指南来评估每个步骤的多个生成路径,从而引导过程获得更高质量的结果。大量的实验证实我们的方法显着提高了生成图像的最终质量。代码:https://github.com/jjaxonx/DRM。