论文
用于超高分辨率图像编辑的免调整潜在扩散模型
Tuning-Free Latent Diffusion Models for Ultrahigh-Resolution Image Editing
摘要
最近基于扩散的生成模型在图像生成和编辑方面表现出了令人印象深刻的性能。然而,由于内存限制以及收集高分辨率训练图像的高成本,现有方法通常仅限于线性分辨率低于 1K 的输入。相比之下,现代移动设备拍摄的照片通常达到高达 8K 的线性分辨率,揭示了当前功能与现实需求之间的巨大差距。简单地放大低分辨率的编辑结果通常会导致视觉上放大但模糊的图像,缺乏精细的细节。本文介绍了 UltraDiffEdit,这是一种新颖的免调整图像编辑框架,可将现成的潜在扩散模型 (LDM) 扩展到超高分辨率。 UltraDiffEdit 采用多尺度渐进式编辑策略,以从粗到细的方式迭代地将高分辨率编辑内容与未编辑区域混合。我们采用多补丁编码来保留潜在空间内已编辑和未编辑的视觉细节。为了减轻编辑伪影,我们的全局局部一致性去噪技术一致地集成了编辑和未编辑的潜在特征,确保编辑边界处从潜在表示到最终图像的平滑过渡。我们还引入了一种基于补丁的混合采样方法,可以捕获局部、中间和全局特征,确保语义连贯性并增强去噪过程中的精细细节。我们进行了大量的实验,证明了 UltraDiffEdit 卓越的编辑质量和灵活性:它仅使用单个 NVIDIA GeForce RTX 3090 GPU 即可处理高达 8K 的图像分辨率。源代码可在 https://github.com/LonglongaaaGo/UltraDiffEdit 上公开获取。