论文
QK-Wanda:耦合查询和键进行非结构化剪枝
QK-Wanda: Coupling Queries and Keys for Unstructured Pruning
摘要
Wanda(Sun et al., 2024)通过在每个线性投影内独立地评分权重来修剪大语言模型,尽管查询和键通过点积交互。我们引入了 QK-Wanda,它在未屏蔽的预 RoPE 重建目标下根据查询和密钥的单独删除成本对查询和密钥权重进行评分。它使用来自相反投影的信息(查询权重的键和键权重的查询)来增强 Wanda 分数,从而允许两个投影共享修剪预算。其封闭式分数不需要梯度或权重更新;根据我们主要实验中使用的校准,完全修剪在 A100 上比 Wanda 长 1.3%,在 H200 上比 Wanda 长 3.1%。我们评估了 TinyLlama、Llama 2、Llama 3 和 Qwen2.5 的 15 个模型的仅 QK 剪枝,参数范围为 0.5B-72B。相对于 Wanda,QK-Wanda 在 50% 稀疏度下 QK 重建误差平均降低了 60%,在 80% 稀疏度下平均降低了 45%。下游收益取决于模型。 Llama 2 70B 的稀疏度为 80% 时,WikiText-2 和 C4 的困惑度分别降低了 20.3% 和 13.5%,而平均零样本准确度则提高了 5.94 个百分点。 Qwen2.5-72B 也有所改进,但 Llama-3.1-70B 尽管重建误差较低,但困惑度却大大提高。这些结果既显示了耦合剪枝标准的前景,也显示了局部重建作为模型质量预测因子的局限性。