论文
从广泛探索到稳定合成:自回归图像生成的熵引导优化
From Broad Exploration to Stable Synthesis: Entropy-Guided Optimization for Autoregressive Image Generation
摘要
将思想链 (CoT) 与强化学习 (RL) 相结合可改善文本到图像 (T2I) 的生成,但 CoT 的探索和 RL 的优化之间的潜在相互作用仍不清楚。我们提出了一种基于熵的系统分析,得出了三个关键见解:(1)CoT 扩大了生成探索空间,而 RL 将其收缩到高回报区域; (2)最终奖励与图像词元熵的均值和方差均呈强负相关,凸显了减少不确定性和不稳定性的必要性; (3) 文本 CoT 的熵直接控制下游图像质量,较低熵的 CoT 会产生更好的生成。受这些发现的启发,我们提出了熵引导组相对策略优化(EG-GRPO),这是一种 微调 策略,通过不确定性重新分配优化预算:低熵词元被排除在奖励驱动的更新之外以保持稳定性,而高熵词元则获得熵奖励,鼓励结构化探索而不崩溃。标准 T2I 基准测试的实验表明 EG-GRPO 实现了最先进的性能。