论文
用于无样式编码器扩散风格化的尺度分离调节
Scale-Separated Conditioning for Style-Encoder-Free Diffusion Stylization
摘要
基于参考的扩散风格化需要将目标几何形状与可转移外观分开。现有的基于调整的方法通常依赖于对齐的内容风格目标三元组或辅助视觉编码器,这增加了数据成本并且可以从风格参考中传输非预期的场景结构。我们提出 SEFS(无样式编码器风格化),一种用于扩散 Transformer 的无样式编码器调节框架。 SEFS 从单个训练图像的随机低分辨率裁剪中形成风格标记。此裁剪瓶颈保留了局部外观统计信息,例如调色板、描边、纹理和材质,同时减少了对全局布局提示的访问。目标内容由边缘和分割线索进行编码,并通过参数高效的可训练投影与潜在的噪声融合。我们为标记统计对齐添加了风格去噪重新归一化,并为空间细节添加了跨块跳跃融合。 SEFS 在未配对的单张图像上进行训练;冻结扩散 VAE 仅用于将图像条件放置在潜在空间中。在艺术风格化基准上,SEFS 提高了内容一致性和泄漏诊断,同时保留参考风格的亲和力,并且消融支持裁剪分辨率、重新标准化和跳过融合选择。 SEFS的代码将公开。