论文

SIDiffAgent:自我改进的扩散智能体

SIDiffAgent: Self-Improving Diffusion Agent

智能体系统Agent 架构与控制循环

摘要

文生图扩散模型革新了生成式AI,能够合成高质量、照片级逼真的图像。然而其实际部署仍受若干限制阻碍:对提示词措辞敏感、语义解释存在歧义(如“mouse”既可指动物也可指计算机外设)、出现解剖结构扭曲等伪影,以及需要精心工程化的输入提示。现有方法通常需要额外训练且可控性有限,限制了它们在真实应用中的适应性。我们提出自我改进扩散智能体(Self-Improving Diffusion Agent,SIDiffAgent),一个无需训练的Agentic框架,利用Qwen系列模型(Qwen-VL、Qwen-Image、Qwen-Edit、Qwen-Embedding)来应对这些挑战。SIDiffAgent自主管理提示词工程,检测并纠正不良生成结果,并执行细粒度伪影移除,从而产出更可靠、更一致的输出。它还通过将过往经验存入数据库来纳入迭代式自我改进;这一过往经验数据库随后用于在Agentic流程的每个阶段注入基于提示的引导。本文方法在GenAIBench上取得平均VQA得分0.884,显著优于开源模型、专有模型与Agentic方法。论文被接收后我们将公开代码。

SIDiffAgent:自我改进的扩散智能体
图4:第一行显示 T2I-Copilot 在无记忆情况下生成的图像,第二行显示我们方法的输出。当记忆中包含结果相互冲突的相似提示时,它有时会误导智能体,导致在相似场景之间生成不一致的结果。