论文

Generation Navigator:用于图像生成的状态感知代理框架

Generation Navigator: A State-Aware Agentic Framework for Image Generation

模型训练强化学习

摘要

尽管文本到图像生成技术取得了快速进步,但忠实地实现用户意图仍然具有挑战性,通常需要手动多轮试错。为了实现此过程的自动化,现有系统依赖于简单的提示重写或由手工制定的规则驱动的闭环代理,而不是学习使操作适应不断发展的生成过程。在本文中,我们将图像生成重新表述为状态条件动作制定问题,并提出了 Generation Navigator,这是一种多轮 T2I 代理,可以学习动态引导生成轨迹并输出下一个动作。然而,通过强化学习训练这个智能体会带来一个关键的贡献分配挑战:天真地奖励仅基于单个状态的轨迹,为采样轨迹中的所有动作分配相同的信用,忽略转弯的质量动态,并且无法区分改善轨迹的动作和那些降低轨迹或浪费转弯而没有进展的动作。我们通过 PRE-GRPO(峰值保留效率组相对策略优化)解决了这个问题,这是一个轨迹级强化学习目标,它明确奖励发现高质量图像(峰值),避免随后的转弯质量下降(保留),并最大限度地减少不必要的转弯(效率)。实验表明,各个基准测试都有显着改进,在 T2I-ReasonBench 上达到了 0.90 的 WISE 分数和 79.06% 的推理准确度。