论文
用于文本到图像生成的注意特征空间中的正交负指导
Orthogonal Negative Guidance in Attention Feature Space for Text-to-Image Generation
摘要
文本到图像 (T2I) 模型生成高质量图像的能力越来越强。然而,强制明确不存在指定的对象或属性仍然是一个根本上具有挑战性的问题。现有的方法,包括即时否定、事后编辑和负面指导,仍然不足以实现明确的概念抑制,通常无法删除目标概念或降低整体图像质量。为此,我们提出了注意特征空间中的正交负指导,这是一种在基于 MM-DiT 的 T2I Transformer 的注意输出空间中运行的 无需训练 方法。我们的方法将消极提示注意特征与积极提示特征正交化,并仅减去正交分量,抑制不需要的概念,同时保留所需的语义。在 FLUX-dev 和 FLUX-schnell 上的实验表明,我们的方法在概念抑制、即时对齐和图像质量之间实现了有利的权衡。在人类评估中,我们的方法比第二好的基线高出 18.78%。我们进一步表明我们的方法支持多概念抑制和可调整概念抑制。