论文

VAE 潜空间的颜色子空间及数值化生成控制

On Color Alignment in VAE Latent Spaces and Its Applications

模型推理解码与生成控制

摘要

变分自动编码器 (VAE) 是现代文本到图像模型的关键部分,它在 潜空间 内生成图像。众所周知,VAE 可以理清数据变化的主要因素,而颜色是自然图像中最具结构化的因素之一:对其进行解相关会产生一个亮度轴和两个相反颜色轴。因此,颜色应该会成为 VAE 潜空间 中的一个独特因素。然而,这些潜在空间如何代表颜色仍然很大程度上未被探索。在这项工作中,我们展示了文本到图像模型的 VAE 共享与亮度和对手颜色对齐的颜色子空间。通过编码器的线性近似和有针对性的潜在控制,我们发现这个子空间在从 SD1.5 到 FLUX.2 和 Z-Image 的各种 VAE 中都是一致的。在此特征的基础上,我们提出了三个应用程序:ColorTuning,它在 GenColorBench 的细粒度 CSS3/X11 系统上实现了最先进的精确数字颜色生成;饱和度控制,用于调整全局色度强度;以及颜色传输,用于更改调色板以匹配参考。代码和模型可在 https://julian075.github.io/Color_Subspace/ 上公开获取

VAE 潜空间的颜色子空间及数值化生成控制:论文原图
图 16:我们的方法概述。顶部:表征 VAE 的颜色基础(第 4.1 节)。每个潜在通道在一组参考对象的区域内受到扰动,CIELAB 中产生的偏移形成一个灵敏度矩阵,其 SVD 给出亮度和对手颜色方向。每个 VAE 计算一次。底部:推理时的颜色调整(第 4.2 节)。提示中的数字代码将替换为最接近的颜色名称。在门步骤中,对预测的干净潜在 $\hat{z}_{0}$ 进行解码,使用 SAM 3 对对象进行分割,并测量其平均颜色。 MLP 将此颜色和目标映射到沿颜色基础的位移,该位移在其余步骤中添加到对象蒙版内。