论文
蒙版生成 Transformer 是您进行图像编辑所需的工具
Masked Generative Transformer Is What You Need for Image Editing
摘要
扩散模型主导图像编辑,但其全局去噪机制将编辑区域与周围环境纠缠在一起,导致修改传播到应保持完整的区域。我们通过利用 Masked Generative Transformer (MGT) 提出了一种根本不同的方法,其本地化词元预测范式自然地将更改限制在预期区域。我们推出了 EditMGT,这是第一个基于 MGT 的编辑框架。我们的方法采用多层注意力整合将交叉注意力图聚合为精确的编辑定位信号,并采用区域保持采样来明确防止非目标区域中的词元翻转。为了支持训练,我们构建了 CrispEdit-2M,这是一个涵盖七个类别的 2M 样本高分辨率(>1024)编辑数据集。 EditMGT 仅需 960M 参数,即可在多个基准测试中实现最先进的图像相似度,同时提供 6 倍的更快编辑速度,这表明 MGT 为基于扩散的编辑提供了令人信服的替代方案。