论文
FocusDiT:在扩散 Transformer 中屏蔽查询以生成细粒度图像
FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation
摘要
扩散 Transformer (DiT) 已在生成扩散领域得到广泛采用,通过注意力和前馈 (\text{FFN}) 层推进查询标记的去噪。 FFN 实际上充当解码视觉内容的键值词汇表,其中值嵌入了视觉语义知识。我们提出,关注与更复杂细节相对应的关键查询标记并鼓励模型改进这些标记对于细粒度视觉生成至关重要。为此,我们提出 FocusDiT,它应用屏蔽方案来关注专门输入 FFN 的关键查询标记。屏蔽查询可以从 FFN 词汇表中检索视觉标记,并使用它们来解码其视觉细节。广泛的文本到图像实验验证了标记掩码在增强生成性能方面的有效性。