论文
解耦指导:解开文本到图像个性化中的主题和上下文路径
Decoupled Guidance: Disentangling Subject and Context Pathways in Text-to-Image Personalization
摘要
文本到图像个性化旨在在文本描述的新颖场景中生成用户提供的主题。然而,大多数现有方法通过相同的调节路径对主题身份(保真度)和上下文(可编辑性)进行编码,迫使两者竞争注意力图资源。我们将这种现象称为条件纠缠,并表明它会引起保真度与可编辑性的权衡。我们通过用通用主题标记替换目标主题标记来进一步提供因果证据,这会产生注意力分配的变化以及上下文依从性的相应变化。为此,我们提出了解耦指导(DeGu),这是一种即插即用的框架,可通过两个独立的指导流路由主体身份和场景上下文。我们进一步引入了一种空间混合机制,可以动态融合这些流,确保每个流在其语义相关区域内运行而不会受到干扰。此外,DeGu 可以轻松应用于现有的个性化方法,而无需修改底层骨干模型,持续提高整体个性化性能,同时在不同的方法和骨干中实现保真度-可编辑性平衡的推理时间控制,包括流匹配 Diffusion Transformer (DiTs)。