论文

高效的补充注意力头修剪 Transformer

Complementary Attention Head Pruning for Efficient Transformers

摘要

基于 Transformer 的模型在自然语言处理方面的显着成功源于架构扩展,这导致了大量参数并阻碍了在资源受限环境中的部署。虽然结构化剪枝提供了一种压缩途径,但现有的最先进方法通常依赖于基于梯度的重要性排序或随机门控,这会遭受不稳定、结构退化以及需要大量手动超参数调整的困扰。在本文中,我们介绍了 CAHP(互补注意力头修剪),这是一种新颖的事后框架,它将头选择重新定义为全局图论问题。 CAHP 不是孤立地评估头,而是利用基于图的聚类与信息论距离度量相结合来识别和保留互补注意力头的拓扑多样化子集。在不需要预定义的稀疏水平或修剪比率的情况下,该框架通过识别递减的边际性能曲线来自动确定跨层选定的注意力头的数量,其中修剪额外的头会导致性能急剧下降,这由所选的多项式次数决定。对不同 Transformer 模型尺度的 SST-5 和 MNLI 基准进行的广泛评估表明,CAHP 始终优于竞争基线,特别是在高压缩状态下。此外,我们的结构分析表明,CAHP 避免了基于梯度的剪枝方法的“邻近偏差”,这种方法倾向于主要保留靠近输出的层中的头,而是在模型的中间层中保留一组功能关键的注意头。