论文

STAR:面向文生图RL后训练的时空自适应奖励分配

STAR: SpatioTemporal Adaptive Reward Allocation for Text-to-Image RL Post-Training

模型训练强化学习

摘要

既有文生图生成的RL后训练方法通常把最终图像奖励转为单一标量优势——并以相同强度施加到整条生成轨迹。但文生图天然有时空结构:不同去噪步负责不同生成阶段——而真正决定文本对齐的内容常只出现在图像的一部分。这种粒度失配使策略更新难以聚焦到真正影响奖励的生成组件。为此——我们提出面向文生图扩散与流模型RL后训练的时空自适应奖励(STAR)分配。STAR利用生成模型内部的文图注意力——从提示中用户真正关心的核心内容出发——构建随去噪步与rollout动态变化的空间分配图——把同样的组相对优势分配到更相关的潜空间区域——几乎零额外计算开销。STAR随后经空间分辨的策略目标对这些区域施加更强的策略更新。我们以Stable Diffusion 3.5 Medium为基座——在三个任务上评估:GenEval、OCR文字渲染与PickScore。实验结果表明STAR在不改变外部奖励源的情况下改进组合语义对齐、文字渲染与偏好优化——在GenEval、OCR与PickScore上分别取得0.9759、0.9757与23.60。

STAR:面向文生图RL后训练的时空自适应奖励分配:论文配图
图 1:STAR(时空自适应奖励分配)概述。考虑到相同的图像级组相对优势,STAR 从生成主干中提取文本图像注意力图,并构建特定于时间步长的空间分配图,突出显示与关键提示组件相对应的潜在区域。这些地图将标量优势路由到空间解析的训练信号中,因此策略更新有选择地关注确定文本对齐的生成区域。