论文
AnchorDiff:通过基于锚点的图传播实现 MM-DiT 的 无需训练 概念基础
AnchorDiff: Training-Free Concept Grounding for MM-DiTs via Anchor-Based Graph Propagation
摘要
多模态扩散 Transformer (MM-DiTs) 为 无需训练 概念基础编码丰富的表示,但现有的基于注意力的方法通常会在视觉上令人困惑的概念上产生重叠激活,这是一种我们称为概念泄漏的故障模式,其中目标响应溢出到非目标对象。为了解决这个问题,我们提出了 AnchorDiff,一种 无需训练 基础方法,它将语义定位与结构细化分离。 AnchorDiff 从概念到图像的注意力图中选择一个高置信度锚点,并将其作为单热种子传播到从图像到图像的自注意力导出的混合图上。该图使用输出空间相似性进行密集的对象内传播,并使用行式注意门来抑制跨对象连接。此外,我们引入了多概念混淆数据集,其中包含具有多个视觉相似概念和单独掩模的图像,从而能够对概念泄漏进行明确评估。实验表明,AnchorDiff 在 ImageNet-Segmentation 和 PascalVOC 上实现了强大的基础性能,同时大大减少了多概念混淆数据集上的概念泄漏。