论文
概念指导:用于文本到图像生成的精确 无需训练 潜在控制
Concept Guidance: Precise, Training-Free Latent Control for Text-to-Image Generation
摘要
文本到图像扩散模型有两个主要缺点,严重限制了它们的实用性:(1)标准模型缺乏连续的、特定于概念的指导的内在机制(例如,精确控制图像的美观程度),(2)它们对于需要高度局部一致性的任务(例如,生成文本或人手)缺乏可靠性。为了解决这些问题,我们引入了概念方面的互信息的新概念,并发现各个层之间存在较大的、依赖于概念的差异,证明特定结构的生成位于网络的不同部分。我们通过强化概念指导 (CoG) 中概念相关层的影响来利用这一见解,概念指导是一种精确的、针对特定目标的指导方法,适用于开箱即用的模型,无需额外的训练、外部模型、梯度或提示工程。 CoG 首先量化每个层的特定于概念的影响,然后使用跳过概念相关层生成的预测的加权组合来指导去噪。我们展示了各种目标和流行模型(如 PixArt-alpha、SD3、SD3.5 和 FLUX.1-dev)的性能提升。代码可在 https://github.com/CompVis/concept_guidance 获取