论文

ToolArtist:使用工具的统一多模态模型进行代理图像生成

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

模型训练强化学习

摘要

文本到图像(T2I)模型可以生成视觉上引人注目的图像,但它们在需要复杂语义理解、多步骤推理和外部世界知识整合的开放世界任务上仍然受到限制。现有的工作将代理功能引入图像生成中,但它们要么规定固定的工作流程,要么仅将开放世界图像生成过程的子集置于代理控制之下。因此,推理、工具调用和图像生成不是由单一策略协调的。我们提出了 ToolArtist,这是一种通过 后训练 统一多模态模型(UMM)获得的完全代理图像生成模型。 ToolArtist 在一项统一策略内动态协调推理、外部工具使用和本机图像生成。在监督 微调 (SFT) 期间,我们为教师代理配备了搜索工具和图像生成工具。然后,我们将收集到的轨迹转换为 UMM 兼容格式,其中图像生成工具被隐藏,而生成的图像被保留。在强化学习 (RL) 过程中,我们为 UMM 开发了代理 RL 基础设施,并引入了 Reason-Act-Draw GRPO (RAD-GRPO),它使用互补的意图和质量奖励来共同优化模型。实验表明,将整个开放世界图像生成过程置于代理策略下始终优于使用固定管道或仅部分代理控制组件的方法。我们发布了训练数据和完整的 后训练 基础设施。