论文

Rényi Entropy:一种新的视觉通证修剪指标 Transformer

Rényi Entropy: A New Token Pruning Metric for Vision Transformers

模型推理推理加速

摘要

Vision Transformer (ViTs) 实现了最先进的性能,但受到自注意力 $O(N^2)$ 复杂性的影响,使得高分辨率输入的推理成本高昂。为了解决这个瓶颈,词元修剪已成为加速推理的关键技术。大多数现有方法依赖 [CLS] 标记来估计补丁重要性。然而,我们认为 [CLS] 标记在语义表示仍不成熟的早期层中可能不可靠。因此,早期层的剪枝常常会导致重要性估计不准确和不必要的信息丢失。在这项工作中,我们提出了一个 无需训练 词元重要性度量,即 Col-Ln,它源自 Rényi 熵,能够从网络的第一层识别信息性词元,从而在词元减少中实现更可靠的修剪。对 ViT 和大型视觉语言模型 (LVLM) 的大量实验表明,我们的方法在不同的基准测试中始终优于最先进的修剪方法。