论文

幅度轮廓修剪:用于Transformer压缩的免校准结构化注意力头去除

Magnitude Profile Pruning: Calibration-Free Structured Attention Head Removal for Transformer Compression

摘要

注意力头的结构化修剪提供了一种硬件友好的方式来压缩 Transformer 语言模型。然而,现有的测量头部重要性的方法需要校准数据、梯度计算或 Hessian 估计。这些要求增加了额外的开销并使方法依赖于数据。我们的工作提出了幅度分布(MP)评分,这是一种无需训练的头部重要性标准,通过对重量行规范的统计异常值检测来识别可有可无的头部。投影权重落在总体范围内的头部被修剪,而表现出异常规范(具有不成比例的代表性能力)的头部则被保留。我们的工作进一步给出了 MP-G,这是一种通过在关联查询头之间分配共享键值组分数来处理分组查询注意力(GQA)的变体。在以 12.5%-50% 头部稀疏度对 WikiText-2 困惑度进行评估的五个模型中,MP-G 在所有稀疏度水平下在 OPT-6.7B 上实现了最佳困惑度(12.5% 时为 18.46,25% 时为 27.87,50% 时为 152.0)。 MP-G 还在 RoBERTa-large 上以 12.5% 和 25% 的稀疏度给出了最佳结果,困惑度值为 7.27 和 10.28,优于依赖于校准的基线,包括 Wanda-Head、SparseGPT-Head 和 Gradient-Head。它需要零前向传递、校准样本或梯度计算。在稀疏度为 50% 的情况下,头部剪枝可减少高达 16% 的参数,同时节省 50% 的注意力 FLOP。我们的结果表明,仅权重统计评分可以匹配或优于结构化头修剪的数据相关方法,为 Transformer 压缩提供实用的零成本标准。