论文
SIDiffAgent:自我改进的扩散智能体
SIDiffAgent: Self-Improving Diffusion Agent
摘要
文生图扩散模型革新了生成式AI,能够合成高质量、照片级逼真的图像。然而其实际部署仍受若干限制阻碍:对提示词措辞敏感、语义解释存在歧义(如“mouse”既可指动物也可指计算机外设)、出现解剖结构扭曲等伪影,以及需要精心工程化的输入提示。现有方法通常需要额外训练且可控性有限,限制了它们在真实应用中的适应性。我们提出自我改进扩散智能体(Self-Improving Diffusion Agent,SIDiffAgent),一个无需训练的Agentic框架,利用Qwen系列模型(Qwen-VL、Qwen-Image、Qwen-Edit、Qwen-Embedding)来应对这些挑战。SIDiffAgent自主管理提示词工程,检测并纠正不良生成结果,并执行细粒度伪影移除,从而产出更可靠、更一致的输出。它还通过将过往经验存入数据库来纳入迭代式自我改进;这一过往经验数据库随后用于在Agentic流程的每个阶段注入基于提示的引导。本文方法在GenAIBench上取得平均VQA得分0.884,显著优于开源模型、专有模型与Agentic方法。论文被接收后我们将公开代码。
