论文
STAR:面向文生图RL后训练的时空自适应奖励分配
STAR: SpatioTemporal Adaptive Reward Allocation for Text-to-Image RL Post-Training
摘要
既有文生图生成的RL后训练方法通常把最终图像奖励转为单一标量优势——并以相同强度施加到整条生成轨迹。但文生图天然有时空结构:不同去噪步负责不同生成阶段——而真正决定文本对齐的内容常只出现在图像的一部分。这种粒度失配使策略更新难以聚焦到真正影响奖励的生成组件。为此——我们提出面向文生图扩散与流模型RL后训练的时空自适应奖励(STAR)分配。STAR利用生成模型内部的文图注意力——从提示中用户真正关心的核心内容出发——构建随去噪步与rollout动态变化的空间分配图——把同样的组相对优势分配到更相关的潜空间区域——几乎零额外计算开销。STAR随后经空间分辨的策略目标对这些区域施加更强的策略更新。我们以Stable Diffusion 3.5 Medium为基座——在三个任务上评估:GenEval、OCR文字渲染与PickScore。实验结果表明STAR在不改变外部奖励源的情况下改进组合语义对齐、文字渲染与偏好优化——在GenEval、OCR与PickScore上分别取得0.9759、0.9757与23.60。
