论文

InterleaveThinker:强化代理交错生成

InterleaveThinker: Reinforcing Agentic Interleaved Generation

智能体系统模型训练强化学习Agent 协作Agentic RL

摘要

最近的图像生成器在单图像生成和编辑方面展示了令人印象深刻的照片级真实感和指令跟踪功能。然而,受其架构的限制,它们无法实现交错生成(文本图像序列),而交错生成在视觉叙事、引导和具体操作方面具有重要应用。即使是最新的开源统一多模式模型(UMM)在这方面也表现出有限的性能。在本文中,我们介绍了 InterleaveThinker,这是第一个多智能体管道,旨在赋予任何现有图像生成器交错生成功能。具体来说,我们采用规划器代理来组织图像文本输入序列,指示图像生成器执行每一步所需的操作。随后,我们引入一个批评代理来评估生成器的输出,识别偏离计划指令的样本,并完善再生指令。为了实现此管道,我们构建了 Interleave-Planner-SFT-80k 和 Interleave-Critic-SFT-112k 来执行格式冷启动。然后,我们开发了 Interleave-Critic-RL-13k,以使用 GRPO 增强生成轨迹内的逐步指令校正能力。由于单个交错生成轨迹可能涉及超过 25 个生成器调用,因此优化整个轨迹在计算上是不切实际的。因此,我们提出了准确度奖励和逐步奖励,让单步强化学习能够有效引导整个生成轨迹。结果表明 InterleaveThinker 提高了各种图像生成器的性能。在交错生成基准测试中,它实现了与 Nano Banana 和 GPT-5 相当的性能。令人惊讶的是,它还显着增强了基于推理的基准的基础模型;例如,在 4 步 FLUX.2-klein 上,我们观察到 WISE 和 RISE 取得了显着的进步。