论文
MAVISEG:扩散中零样本开放词汇分割的流形传播和视觉原型 Transformer
MAVISEG: Manifold Propagation and Visual Prototypes for Zero-Shot Open-Vocabulary Segmentation in Diffusion Transformers
摘要
文本到图像扩散 Transformer 通过学习生成对象和场景来了解它们,使它们成为 无需训练 零样本开放词汇语义分割的有力候选者。最先进的归因方法对每个像素进行独立评分,将其特征与固定的文本派生类表示进行比较,无论是作为输出空间相似性还是作为交叉注意力权重。这会丢弃模型本身暴露的结构化信号:生成轨迹的时间结构、每个概念的视觉外观统计数据以及图像自身的成对特征几何形状。我们提出了 MAVISEG,一个恢复这些信号的 无需训练 细化层。由于其算子仅消耗逐个概念的评分字段和像素特征空间,因此 MAVISEG 与捕获无关,而不是依赖于一种归因方法。在六个基准测试中,它在 无需训练 方法中取得了最强的总体结果,包括每个基准测试中的最佳 mIoU。有趣的是,在初始捕获最弱的地方,增益最大,并且各个操作员的贡献取决于他们精炼的领域中的噪声。我们的结果表明,扩散 Transformer 携带的概念级信息比当前归因方法恢复的要多,并且其中大部分信息在到达掩模的过程中丢失,而不是从模型中消失。