论文
AdaPilot:面向跨生成器文本到图像质量优化的场景自适应策略学习
AdaPilot: Towards Scene-Adaptive Policy Learning for Cross-Generator Text-to-Image Quality Optimization
摘要
现有的提高文本到图像生成质量的方法已经从生成器微调和提示优化发展到具有多轮视觉反馈的强化学习。然而,现有的策略与特定的生成器和任务深度耦合,并且学习到的能力很难概括为通用的质量优化策略。因此,我们提出了 AdaPilot,它通过将多轮图像生成制定为马尔可夫决策过程(MDP)并通过端到端强化学习对其进行优化来学习场景自适应、跨生成器可传递的质量优化策略。具体来说,AdaPilot 将策略与生成器内部解耦以实现跨生成器传输,引入场景感知奖励,自适应地将质量评估维度与任务语义对齐,并采用流程级奖励来建模图像质量的演化轨迹。实验结果表明,AdaPilot 在生成质量和泛化方面优于基线。单独的跨生成器评估进一步表明,单一策略将零样本转移到看不见的生成器,同时在所有评估的生成器上保持正的平均收益。我们的项目可以通过此 https URL 获取。