论文
FineEdit:使用边界框指导进行细粒度图像编辑
FineEdit: Fine-Grained Image Edit with Bounding Box Guidance
摘要
基于扩散的图像编辑模型在现实世界的应用中取得了重大进展。然而,传统模型通常依赖于自然语言提示,这通常缺乏定位目标对象所需的精度。因此,这些模型由于其全局图像再生范例而难以保持背景一致性。认识到视觉提示为用户提供了一种直观的方式来突出显示感兴趣的特定区域,我们利用边界框作为指导来明确定义编辑目标。这种方法确保扩散模型能够准确定位目标,同时保持背景一致性。为了实现这一目标,我们提出了 FineEdit,一种多级边界框注入方法,使模型能够更有效地利用空间条件。为了支持这种高精度指导,我们提出了 FineEdit-1.2M,这是一个大规模、细粒度的数据集,包含 120 万个具有精确边界框注释的图像编辑对。此外,我们构建了一个名为 FineEdit-Bench 的综合基准,其中包括 10 个主题的 1,000 张图像,以有效评估基于区域的编辑能力。 FineEdit-Bench 的评估表明,我们的模型在指令合规性和背景保留方面显着优于最先进的开源模型(例如 Qwen-Image-Edit 和 LongCat-Image-Edit)。对开放基准(GEdit 和 ImgEdit Bench)的进一步评估证实了其卓越的通用性和鲁棒性。