论文

视觉中注意力头的可解释性引导软剪枝 Transformer

Interpretability-Guided Soft Pruning of Attention Heads in Vision Transformers

摘要

DINOv2 等视觉基础模型可以学习高度表达的表示,但依赖于需要大量计算能力和内存的大规模、不透明的架构。为了为该问题提供可解释引导且有效的解决方案,我们首先基于注意力图的拉普拉斯特征向量,针对个体注意力头提出了频谱分析和新的可视化技术。基于最近对 Vision Transformer 块结构的观察,我们对注意力头进行语义聚类并识别功能冗余。利用这些见解,我们引入了 SAPER(Soft Attention PrunER),这是一种基于 LapSum Soft Top-K 方法的端到端可微剪枝框架。 ImageNet-1K 上的大量实验表明,SAPER 实现了非常有利的准确性与效率权衡,在减少 FLOP 方面优于竞争性 RAPTOR 基线,同时保持了强大的分类性能。