论文

具有实例级和分布级奖励的自回归图像模型的基于策略的调整

Policy-based Tuning of Autoregressive Image Models with Instance- and Distribution-Level Rewards

模型训练强化学习

摘要

自回归(AR)模型对于图像生成非常有效,但其标准最大似然估计训练缺乏对样本质量和多样性的直接优化。虽然强化学习(RL)已被用来调整扩散模型,但这些方法通常会遭受输出多样性崩溃的影响。同样,AR 模型的并发 RL 方法严格依赖于实例级奖励,通常会牺牲分布覆盖率来换取质量。为了解决这些限制,我们提出了一个轻量级的 RL 框架,它将基于词元的 AR 合成转换为马尔可夫决策过程,并通过组相对策略优化 (GRPO) 进行优化。我们的核心贡献是引入了一种新颖的分配级留一法 FID (LOO-FID) 奖励;通过利用特征矩的指数移动平均值,它明确鼓励样本多样性并防止策略更新期间的模式崩溃。我们将其与复合实例级奖励(CLIP 和 HPSv2)相结合,以实现严格的语义和感知保真度,并通过自适应熵正则化项稳定多目标学习。 LlamaGen 和 VQGAN 架构上的大量实验表明,仅在几百次调整迭代内,标准质量和多样性指标就得到了明显改进。结果还表明,即使没有无分类器指导,模型也可以更新以生成有竞争力的样本,并绕过其 2 倍的推理成本。