论文

PixelControl:文本到图像扩散中的细粒度条件保真度

PixelControl: Fine-Grained Condition Fidelity in Text-to-Image Diffusion

应用与实践内容创作

摘要

可控文本到图像的扩散模型通常可以遵循空间条件的全局布局,但仍然违反细粒度结构,例如对象边界、细轮廓和中/小条件区域。这种限制对于基于 VAE 的潜在扩散来说尤其成问题,其中空间压缩会削弱高频和低区域条件信号。我们提出 PixelControl,一种用于细粒度条件保真度的像素空间可控扩散框架。 PixelControl 建立在 PixelDiT 风格的主干基础上,避免了潜在的瓶颈,并引入了两种互补的设计。首先,结构感知控制注入导出条件结构图,并使用它来增强空间敏感区域周围的注入控制残差。其次,多尺度金字塔循环损失根据多种分辨率下的条件衍生结构验证生成的图像,平衡全局布局一致性与局部边界和细节准确性。 PixelControl 通过具有轻量级门控融合的特定模态控制分支支持深度、分割、边缘及其组合。深度、分割和边缘控制方面的实验表明,与现有的可控生成方法相比,PixelControl 提高了结构保真度和视觉质量,尤其是在边界和中/小条件区域方面的增益尤其显着。项目页面可以在:https://linxin0.github.io/pixelcontrol_homepage/pixelcontrol-site/