论文

ExploreNet:学习在 Diffusion GRPO 中探索何处

ExploreNet: Learning Where to Explore in Diffusion GRPO

模型训练强化学习

摘要

组相对强化学习方法(如Flow-GRPO)对图像生成器进行后训练,通过在每个去噪步骤中添加各向同性高斯噪声进行探索。这种噪声决定了模型从哪些rollout中学习,但它同样扰乱了潜在的每个通道和空间位置。在本文中,我们相反表明潜在元素在改变生成图像的程度方面有所不同,因此探索应该适应这些差异。我们引入 EXPLORENET 来学习自适应探索分布。 EXPLORENET 是一种策略,在观察到任何奖励之前,根据当前潜在元素、去噪步骤和提示来预测每个潜在元素的噪声尺度;它根据每个rollout组的奖励离散程度进行训练,并在训练后丢弃,保持推理不变。在 Stable Diffusion 3.5 Medium 上,EXPLORENET 将留出集的 GenEval2 比 Flow-GRPO 提高了 14%,转移到两个独立的构图基准和五个偏好和图像质量模型,并达到 67.2% 的人类偏好胜率。总的来说,在我们的群体相关扩散强化学习实验中,我们发现探索是可以学习的,探索分布的形状比幅度更重要,并且rollout质量比rollout数量更有效。