论文

在您想要的地方进行编辑:区域感知适配器注入,实现无掩模本地图像编辑

Edit Where You Mean: Region-Aware Adapter Injection for Mask-Free Local Image Editing

应用与实践内容创作

摘要

大扩散 Transformer (DiT) 很好地遵循全局编辑指令,但始终将局部编辑泄漏到不相关的区域,因为联合注意架构没有提供明确的通道告诉网络在哪里应用编辑。我们引入了 AdaptEdit,这是一个联合训练的、指令和区域感知的适配器框架,可以将冻结的 DiT 改造为精确的本地编辑器,而无需修改其主干权重。每个 Transformer 块上的轻量级块适配器注入一个结构化条件流,该条件流分解要编辑的内容(指令语义)和要编辑的位置(空间掩码);学习的 SpatialGate 将适配器信号选择性地路由到编辑区域,同时保持图像的其余部分与源几乎相同;区域感知损失将训练目标集中在变化的像素上。由于这些组件使主干网的内部表示能够端到端地感知掩模,因此与编辑器联合训练的薄型 MaskPredictor 头可以直接根据指令和源图像来确定编辑区域,从而消除部署时的任何用户掩模要求。我们评估两个互补的基准:MagicBrush(配对的 真值 目标)用于测量像素级保存和编辑准确性,以及 Emu-Edit Test(无 真值 图像,9 个不同的编辑类别)用于压力测试指令遵循和跨编辑类型的泛化。在这两个方面,AdaptEdit 都实现了最先进的结果,同时优于无掩模和 Oracle 掩模基线。七变体消融干净地隔离了每个组件的贡献。