论文

通过深度卷积加速视觉基础模型

Accelerating Vision Foundation Models with Drop-in Depthwise Convolution

模型推理推理加速

摘要

预训练的视觉基础模型在 微调 有限的任务中提供强大的性能。然而,他们的 Vision Transformer (ViT) 主干网带来了很高的推理成本,限制了在资源受限设备上的部署。在这项工作中,我们通过利用一些注意力头的内在类似卷积的行为来加速大规模预训练的 ViT,同时保留其特征提取能力。具体来说,我们引入了一个高效的基于深度卷积的层,作为这些头的直接替代品。此外,我们提出了简单的策略来确定哪些头可以更换,并引入了恢复下游任务性能的 微调 过程。在图像分类和分割任务中,我们的方法实现了 17-20% 的推理加速,同时性能下降最小。我们通过详细的推导、广泛的实验和效率基准来验证该方法。参考实现是公开的。