论文

CopyCat:在几秒钟内提高主题到图像模型的细粒度主题一致性

CopyCat: Improving Fine-Grained Subject Consistency in Subject-to-Image Models within Seconds

模型训练参数高效训练

摘要

最近的主题到图像模型在个性化图像生成方面取得了令人印象深刻的进展,但它们仍然难以保留细粒度的主题特定细节。一个主要原因是缺乏高质量的细粒度身份监督:收集真实的配对数据的成本很高,而合成的训练对通常只保留粗略的受试者外观,无法捕捉微妙的受试者特定细节。在这项工作中,我们提出了 CopyCat,这是一种轻量级模型细化框架,可以在几秒钟内提高细粒度主题的一致性。 CopyCat 通过附加轻量级细粒度一致性 LoRA (FCLoRA) 并使用单个代理图像对其进行优化,对预训练的主体到图像模型进行一次性细化,该代理图像既用作调节图像又用作重建目标。这种精确的自我重建目标大大简化了优化任务,只需几秒钟即可实现有效的细粒度细化。细化仅进行一次;生成的模型可以直接应用于各种看不见的参考主题和提示,无需进一步针对特定主题进行优化。我们进一步重新审视双流扩散 Transformer 中的主题到图像 LoRA 训练,发现仅调整视觉流始终可以提高主题一致性。 DreamBench 和 XVerseBench 上的大量实验表明,在单主体和多主体设置下,代表性主体到图像模型的细粒度主体一致性得到了持续改进。