论文

CAST:扩散模型的因果优势结构训练与空间基础组合奖励

CAST: Causal Advantage-Structured Training with Spatially Grounded Compositional Rewards for Diffusion Models

模型训练强化学习

摘要

在线强化学习已扩展到用于扩散模型(DM)图像生成的流匹配。然而,这种范式面临三个局限性:(1)窗口选择。现有方法手动设置随机微分方程(SDE)采样窗口,即注入探索噪声的去噪步骤。相反,我们根据每个模型的去噪轨迹来确定它。 (2)奖励饱和。当前的方法依赖于基于人工注释训练的评分模型;我们发现,这样的分数在最新的 SOTA 开源 DM 上几乎无法区分,使得优势评估基本上无效。 (3)样本效率低下。单一标量奖励将不同的失败模式折叠成几乎相同的分数,为有针对性的改进留下最小的梯度指导。为了解决这些问题,我们提出了 CAST(因果优势结构化训练),这是一种用于预训练 DM 的 RL 微调方法,该方法(1)识别每个模型固定图像中的对象及其空间排列的去噪步骤,并使用该时间设置 SDE 窗口,(2)通过因果场景图(CSG)将每个提示分解为可验证原子,即最小语义单元,例如对象、计数、属性、或空间关系,每个原子都可以独立检查,并分别奖励每个原子,(3)通过教师强制注意力将签名的原子级优势投影到像素空间,并使用它们对 SDE 策略目标进行空间加权。我们使用 CAST 对两个最强的开源 DM FLUX.2-dev 和 Qwen-Image-2512 进行了微调,并在 GenEval 2(组合基准)和 Qwen-Image-Bench 上评估它们的整体质量。在几乎相同的训练预算内,CAST 在最具挑战性的 GenEval 2 提示上相对于基本模型的改进高达 Flow-GRPO 的 3.07 倍,同时整体生成质量也有所提高。