论文
为正确步骤分配贡献:视觉生成的目标感知过程优化
Learning to Credit the Right Steps: Objective-aware Process Optimization for Visual Generation
摘要
强化学习,特别是组相对策略优化 (GRPO),已成为具有人类偏好信号的 后训练 视觉生成模型的有效框架。然而,其有效性从根本上受到粗略奖励贡献分配的限制。在现代视觉生成中,多个奖励模型通常用于捕获异构目标,例如视觉质量、运动一致性和文本对齐。现有的 GRPO 管道通常将这些奖励压缩为单个静态标量,并将其均匀地传播到整个扩散轨迹。这种设计忽略了不同降噪步骤的阶段特定作用,并产生不合时宜或不兼容的优化信号。为了解决这个问题,我们提出了目标感知轨迹贡献分配(OTCA),这是一种用于细粒度 GRPO 训练的结构化框架。 OTCA 由两个关键部分组成。轨迹级贡献分解估计不同去噪步骤的相对重要性。多目标贡献分配在整个去噪过程中自适应地加权和组合多个奖励信号。通过对时间维度贡献和目标维度贡献进行联合建模,OTCA 将粗略的奖励监督转换为结构化的、时间步感知的训练信号,该信号更好地匹配基于扩散的生成的迭代性质。大量实验表明,OTCA 能够持续提高跨评估指标的图像和视频生成质量。