论文
选择性聚合注意力图可改善基于扩散的视觉解释
Selective Aggregation of Attention Maps Improves Diffusion-Based Visual Interpretation
摘要
关于文本到图像(T2I)生成模型的大量研究都利用交叉注意力图来提高应用程序性能并解释模型行为。然而,不同注意力头的注意力图的独特特征仍然相对未得到充分探索。在这项研究中,我们表明,有选择地聚合与目标概念最相关的头部的交叉注意力图可以提高视觉可解释性。与基于扩散的分割方法 DAAM 相比,我们的方法获得了更高的平均 IoU 分数。我们还发现,最相关的头部比最不相关的头部更准确地捕捉概念特定的特征,并且选择性聚合有助于诊断即时的误解。这些发现表明,注意力头选择为提高 T2I 生成的可解释性和可控性提供了一个有希望的方向。