论文
APE:用于图像生成和编辑的代理提示增强器
APE: Agentic Prompt Enhancer for Image Generation and Editing
摘要
自然语言已成为图像生成和编辑的强大界面,但文本引导的视觉系统仍然对提示表述高度敏感。语义上相似的请求可以产生不同的输出,具体取决于措辞、特异性以及如何明确地陈述视觉约束,从而激励提示增强作为可训练的组件而不是外围用户的选择。现有的强大增强器通常依赖于大型专有 LLM,例如 ChatGPT 或 Gemini,从而增加了视觉生成管道的成本、延迟和部署依赖性。我们提出了代理提示增强器(APE),这是一个轻量级框架,可以对小语言模型(SLM)进行后训练作为提示增强代理。 APE既支持单代理重写,也支持角色专用的多代理增强。其单代理实例化 SAPE 一次性重写提示,而其多代理实例化 MAPE 将增强分解为路由器-重写器-组合器过程,用于处理对象、属性、空间关系和编辑的组合约束。通过任务感知奖励和 后训练 协议,APE 改进了视觉对齐和提示跟随,而无需修改下游视觉模型。对具有挑战性的图像生成和编辑基准的实验表明,经过训练的小型提示增强器可靠地优于其基础对应物,缩小了与闭源提示增强器的差距;此外,事实证明,MAPE 在这些基准测试中的复杂合成任务上特别强大。