论文
重新思考视觉 Transformer 的深度修剪:异质性感知视角
Rethinking Depth Pruning for Vision Transformers: A Heterogeneity-Aware Perspective
摘要
虽然之前的研究已经通过各种修剪技术成功压缩了视觉 Transformer (ViTs),但大多数研究都集中在宽度修剪上,以实现模型大小的显着减小。深度剪枝从 ViT 中删除整个层,尽管它有可能提供更高的加速,但其精度恢复非常困难,限制了现有联合宽度和深度剪枝方法所实现的加速。在这项工作中,我们揭示了现有深度剪枝方法的失败在于忽略了不同层之间的异构性,并且我们引入了 HetDPT,一种避免维度不匹配的异构性感知深度剪枝方法。在 ImageNet-1K、CIFAR-100、COCO 和 ADE20K 上进行的综合实验验证了我们的方法:HetDPT 在保持精度的同时,为 DeiT-B 实现了 1.58$\times$ 的加速,为 DeiT-S 实现了 1.39$\times$ 的加速,几乎没有精度下降。此外,当与宽度剪枝相结合时,HetDPT+在极端ViT剪枝方面创造了新的最先进记录,将Isomorphic-Pruning-2.6G配置的加速比从4.24$\times$提高到5.19$\times$,同时保持近乎无损的精度;我们的代码可在 https://github.com/Efficient-AI-for-All/HetDPT 获取。