论文

扩散Transformer中空间关系生成的电路机制

Circuit Mechanisms for Spatial Relation Generation in Diffusion Transformers

模型评测模型行为与机制分析

摘要

扩散Transformer(DiT)极大地推动了文本到图像生成,但模型仍难以按文本提示生成对象之间正确的空间关系。在本研究中,我们采用机制可解释性方法,研究DiT如何在对象之间生成正确的空间关系。我们从零开始训练不同规模、使用不同文本编码器的DiT,让它们学习生成包含两个对象的图像,对象的属性与空间关系由文本提示指定。我们发现,尽管所有模型都能以近乎完美的准确率学会该任务,其底层机制却因文本编码器的选择而有巨大差异。当使用随机文本嵌入时,我们发现空间关系信息经由一个两阶段电路传递给图像token,该电路涉及两个交叉注意力头,分别读取文本提示中的空间关系和单对象属性。当使用预训练文本编码器(T5)时,我们发现DiT使用另一条电路,利用文本token中的信息融合,从单个文本token中一并读取空间关系与单对象信息。我们进一步表明,尽管两种设置在域内性能相似,但它们对域外扰动的鲁棒性不同,这可能暗示在真实场景中生成正确空间关系的难度。

扩散Transformer中空间关系生成的电路机制 配图
图 1:模型与任务示意图。我们的 T2I 模型架构采用了 PixArt [5] 的设计。它包含三个主要组件:将分词后的自然语言提示处理为文本嵌入的文本编码器、将图像输入处理为图像 token 的 VAE,以及作为去噪扩散过程主干的扩散 Transformer(DiT)。文本信息经由每个 DiT 块中的交叉注意力机制传递,并影响图像 token 的去噪。任务是生成具有指定空间关系的两个物体。