论文
MAR-GRPO:用于 AR 扩散混合图像生成的稳定 GRPO
MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation
摘要
强化学习(RL)已成功应用于自回归(AR)和扩散模型。然而,由于交错推理和噪声对数概率估计,将强化学习扩展到混合 AR 扩散框架仍然具有挑战性。在这项工作中,我们研究了掩蔽自回归模型(MAR),并表明扩散头在训练动力学中起着至关重要的作用,通常会引入导致不稳定和早期性能饱和的噪声梯度。为了解决这个问题,我们提出了一个稳定的 MAR 强化学习框架。我们引入了多轨迹期望(MTE),它通过对多个扩散轨迹进行平均来估计优化方向,从而减少扩散引起的梯度噪声。为了避免过度平滑,我们进一步从多个轨迹估计标记方面的不确定性,并仅对前 k% 的不确定标记应用多轨迹优化。此外,我们引入了一种一致性感知的词元选择策略,该策略可以过滤掉与最终生成的内容不太一致的 AR 词元。跨多个基准的大量实验表明,与基线 GRPO 和 pre-RL 模型相比,我们的方法持续提高了视觉质量、训练稳定性和空间结构理解。代码位于:https://github.com/AMAP-ML/mar-grpo。