论文

IEA:通过多任务对齐的三个阶段的业余友好的对话式图像编辑代理

IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment

智能体系统Agent 工具调用

摘要

当前的图像编辑软件通常依赖于固定的过滤器或专家调整,从而在业余用户的意图和结果之间留下了差距。生成模型的创作可能包含伪影、难以置信的细节或偏离照片写实主义的风格,并且无法深入了解编辑的原因。我们提出了 IEA,一种会话式图像编辑代理,它学习在明确的、可解释的动作空间中操作参数化工具。 IEA 通过三阶段多任务管道进行训练:(1) 基于专家编辑的 SFT,(2) GRPO,对相似性改进、工具实用性和意图总结进行奖励,以及 (3) 大规模合成 微调,共同掌握图像编辑、细化和用户意图总结。通过逐步操作 16 个编辑工具,IEA 生成可以检查和调试的透明编辑轨迹。在定量实验中,与强基线相比,它在编辑任务上获得了更低的像素距离,在摘要任务上获得了更高的 ROUGE-L。在用户研究中,它在指令遵循的工具调用方法中排名最高,同时在整体感知质量方面超越了生成方法。我们的结果验证了可解释、以工具为中心的 VLM 是人类指令引导图像修饰的可靠途径。