论文
使用 GRPO 改进视觉表示对齐生成
Improving Visual Representation Alignment Generation with GRPO
摘要
最近的扩散 Transformer 表现出了强大的图像合成能力,但由于生成表示和判别表示之间的对齐较弱,训练效率仍然较低。虽然 REPA 等表示对齐框架通过将噪声去噪特征与预训练的视觉编码器对齐来提高收敛性,但它们的外部监督对齐损失是静态的,并且在训练和推理过程中缺乏适应性。现有方法依赖于固定的余弦对齐或对比目标,无法动态平衡表示一致性和生成质量,导致区分效果有限,并且无法以任务自适应的方式优化对齐。为了解决这个问题,我们提出了 VRPO,一种基于强化的优化策略,用生成表示策略优化目标取代 REPA 的静态对齐损失。 VRPO 没有强制执行固定的相似性约束,而是将表示对齐视为奖励引导的过程:模型根据生成保真度、感知质量以及扩散特征和预训练视觉嵌入之间的语义一致性来接收自适应奖励。这种公式使生成器能够不断地向语义上有意义的方向细化其内部表示,同时提高图像质量。我们的 VRPO 驱动训练无缝集成到扩散 Transformer 中,引入的计算成本可以忽略不计,并保持与 SiT 和 DiT 架构的完全兼容性。在 ImageNet-256x256 上进行的大量实验表明,我们的 VRPO-Alignment 极大地增强了收敛性和保真度,与相同计算预算下的 REPA 相比,FID 改进高达 +1.8,训练速度提高了 2.3 倍。