论文

CLIP 中密集开放词汇预测的稀疏注意力

Sparse Attention for Dense Open-Vocabulary Prediction in CLIP

模型架构Transformer

摘要

对比语言图像 预训练 (CLIP) 依赖于基于 softmax 的自注意力,这是一种严格的正分布,它将概率质量分配给每对标记,甚至是语义上不相关的标记。虽然这些密集的 softmax 权重对于在 预训练 期间收集广泛的上下文非常有效,但它们将注意力分散到许多低显着性标记上,产生的噪音掩盖了密集、开放词汇预测所需的细粒度、空间局部线索。我们研究了最终视觉自注意力层中行式 softmax 与 $α$-entmax 变换的推理时间替换,应用于标准查询键注意力和自相关变体。由于 entmax 应用了一个与数据相关的阈值,将低分精确映射到零,因此它充当隐式降噪器,将上下文不相关的依赖项归零,同时将质量重新分配到最相关的标记上。我们评估开放词汇任务——密集语义分割(Pascal VOC、Pascal Context、ADE20K)和细粒度检索(FG-OVD)——并发现注意力稀疏化的增益与基线注意力从目标类扩散的程度成正比。