论文

WhereEdit:用于一步图像编辑的掩模感知本地潜在编辑

WhereEdit: Mask-aware Local Latent Editing for One-Step Image Editing

应用与实践内容创作

摘要

最近的一步文本到图像(T2I)模型可以实现高效的图像合成,并为实时图像编辑提供新的机会。然而,现有的一步编辑方法主要依赖文本条件进行语义转换,缺乏对编辑 \textit{where} 的明确空间控制。更重要的是,即使引入空间约束,这些方法通常也很难在目标区域内实现强大且稳定的语义修改。在这项工作中,我们从空间控制的角度重新审视一步图像编辑,并确定了两个关键挑战:发现可编辑区域和实现有效的局部语义转换。我们发现现有方法执行全局语义传输,这限制了一步设置下的高强度本地编辑。为了解决这个问题,我们提出了 \textbf{WhereEdit},这是一种将一步编辑重新表述为本地化自适应编辑的框架。 WhereEdit 自动从内部模型特征中识别语义相关区域,并应用自适应局部调制来增强目标区域编辑,同时保留非目标区域和结构一致性。 PIE-Bench 基准测试表明,WhereEdit 始终优于现有的一步图像编辑方法,在保持一步生成效率的同时实现卓越的编辑质量。区域级监督的其他实验进一步强调了显式空间推理对于高质量一步图像编辑的重要性。