论文
上下文空间中的动态排斥以实现扩散的丰富多样性 Transformer
On-the-fly Repulsion in the Contextual Space for Rich Diversity in Diffusion Transformers
摘要
现代文本到图像(T2I)扩散模型已经实现了显着的语义对齐,但它们常常严重缺乏多样性,对于任何给定的提示都集中在一组狭窄的视觉解决方案上。这种典型性偏差给需要广泛生成结果的创意应用带来了挑战。我们确定了当前多样性方法的一个基本权衡:修改模型输入需要昂贵的优化才能纳入来自生成路径的反馈。相反,作用于空间上的中间潜伏往往会破坏正在形成的视觉结构,导致伪影。在这项工作中,我们建议将上下文空间中的排斥力作为一种新颖的框架,以在扩散 Transformer 中实现丰富的多样性。通过干预多模态注意通道,我们在 Transformer 的前向传递过程中应用即时排斥,在块之间注入干预,其中文本调节通过新兴图像结构得到丰富。这允许在结构上通知之后但在构图固定之前重定向引导轨迹。我们的结果表明,上下文空间中的排斥会产生更丰富的多样性,而不会牺牲视觉保真度或语义依从性。此外,我们的方法具有独特的高效性,即使在传统的基于轨迹的干预通常会失败的现代“涡轮”和蒸馏模型中,其计算开销也很小,同时仍然有效。