论文
GRPO自回归文生图后训练中的性能与多样性平衡
Balancing Performance and Diversity in GRPO Autoregressive Text-to-Image Post-Training
摘要
自回归文生图(T2I)生成近期快速进展——但把生成图像与人类偏好对齐仍然充满挑战。GRPO式在线强化学习提供有效框架——但既有方法通常把参照策略散度当作固定值——尽管其直接影响策略优化。我们在统一的f-散度框架内研究这一被忽视的因素——涵盖前向KL、反向KL与JS散度——用于GRPO式自回归T2I对齐。我们的系统理论分析揭示不同散度以不同方式重塑token级更新。特别地——在所用的采样token整形形式下——JS正则实现有利权衡:缓解相对参照策略的均匀偏置——同时仍抑制大偏离。在LlamaGen与Janus-7B上的大量实验表明JS散度在多数评估指标上取得最强或高度竞争力的优化性能——同时保持良好的生成多样性。代码见 GitHub。
