论文

Qwen-Image-Agent:弥合现实世界图像生成中的上下文差距

Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation

智能体系统Agent 架构与控制循环

摘要

虽然文本到图像 (T2I) 模型取得了显着的进步,但它们难以满足现实世界的要求,而这些要求往往是不明确的、隐含的或依赖于最新的知识。我们将这一挑战定义为上下文差距:用户上下文与 T2I 模型的充足生成上下文之间的不匹配。为了弥补这一差距,我们提出了 Qwen-Image-Agent,这是一个统一的代理框架,以上下文为中心的方式集成了计划、推理、搜索、记忆和反馈。 Qwen-Image-Agent 将用户输入视为部分上下文,并通过上下文感知规划和上下文信息收集逐步构建生成上下文。具体来说,情境感知规划可以识别缺失的情境,并计划如何获取和使用它,而上下文信息收集则从推理、搜索、记忆和反馈中收集情境。为了评估代理图像生成,我们进一步引入了图像代理基准(IA-Bench),这是一个涵盖四个核心图像代理功能的基准:计划、推理、搜索和内存。 IA-Bench、Mindbench 和 WISE-Verified 上的实验表明,Qwen-Image-Agent 的性能优于强大的基线,并实现了最先进的性能。