论文
EditRefiner:用于图像编辑细化的人性化代理框架
EditRefiner: A Human-Aligned Agentic Framework for Image Editing Refinement
摘要
最近的文本引导图像编辑(TIE)模型取得了显着的进步,但编辑后的图像仍然经常遇到细粒度问题,例如不自然的物体、光照不匹配和意外的变化。现有的细化方法要么依赖于昂贵的迭代再生,要么采用空间基础薄弱的视觉语言模型(VLM),通常会导致语义漂移和不可靠的局部校正。为了解决这些限制,我们首先构建了 EditFHF-15K,这是编辑图像的细粒度人类反馈数据集,包括(1)来自 12 个 TIE 模型的 15K 图像,涵盖 43 个编辑任务,(2)60K 个带注释的伪影区域和 80K 个编辑失败区域,每个区域都伴有文本推理,以及(3)45K 平均意见得分(MOS),用于评估感知质量、指令遵循和视觉一致性。基于 EditFHF-15K,我们提出了 EditRefiner,这是一个分层的、可解释的、与人类一致的代理框架,它将编辑后校正重新表述为类似人类的感知-推理-行动-评估循环。具体来说,我们介绍:(1)一个感知代理,用于检测伪影和编辑失败的上下文显着图;(2)一个推理代理,用于解释这些感知线索以执行与人类一致的诊断推理;(3)一个动作代理,用于使用推理输出来计划和执行本地化重新编辑;(4)一个评估代理,用于评估重新编辑的图像并指导动作代理是否需要进一步改进。大量实验表明,EditRefiner 在畸变定位、诊断准确性和人类感知对齐方面始终优于最先进的方法,为自我校正和感知可靠的图像编辑建立了新的范例。该代码可从 https://github.com/IntMeGroup/EditRefiner 获取。