论文
ReGain:恢复合成图像个性化中的主题保真度
ReGain: Restoring Subject Fidelity in Personalization on Synthetic Images
摘要
通过 DreamBooth 对少数图像进行微调,文本到图像的扩散模型可针对主题进行个性化。这些图像越来越多地来自扩散模型而不是相机。我们表明,对此类合成图像进行微调会降低主题保真度,产生过饱和的颜色和过多的高频细节。为了找出原因,我们使用相同的 DreamBooth 配方对同一基本模型中的两个模型进行微调,一个基于某个主题的真实照片,另一个基于第一个模型生成的该主题的合成图像。我们将退化追溯到无分类器指导(CFG)。对于在合成图像上个性化的模型,条件和无条件噪声预测之间的角度以及它们差异的范数比在真实照片上个性化的模型大得多。这种膨胀向高频率增长,并且也出现在语义上接近主题的其他提示中,例如其类名词,但不会出现在不相关的提示中。我们提出了 ReGain,这是一种在采样时应用的免训练校正,可测量指导的每个频段相对于基本模型的膨胀程度,并相应地缩小该频段。 ReGain 不需要真实照片。根据 DINO、DINOv2 和 CLIP-I 的测量,在 Stable Diffusion v1.5 上,ReGain 缩小了与真实照片上个性化模型的 51-64% 的主题保真度差距。它还提高了 SDXL 和 SD 3.5 上的主题保真度,并保留所有三个主干上的文本对齐。