论文

通过因果归因进行修剪可保留 大语言模型 中的推理性能

Pruning via Causal Attribution Preserves Reasoning Performance in Large Language Models

摘要

大语言模型 (LLM) 擅长多步推理,但会产生大量推理成本。我们引入了因果归因修剪(CAP),这是一种 无需训练 方法,通过测量关键注意力头对推理任务的因果影响来识别关键注意力头,并使用这些头级分数来指导细粒度的权重修剪。对于每个注意力头,CAP 会估计在前向传递一小部分推理问题时该头被屏蔽时的预期性能下降。然后将这些因果分数转换为相应投影矩阵的权重级别重要性值。与仅幅度或基于激活的标准不同,CAP 的介入测量直接捕获每个头部的功能贡献,在稀疏度为 20% 的 ARC-Challenge 上,相对准确度比 Wanda 提高高达 61%。我们使用 Llama-3-8B-Instruct 和 Mistral-7B-Instruct 在 10%、20% 和 50% 稀疏度下评估 GSM8K、StrategyQA 和 ARC-Challenge 上的 CAP。在中等稀疏度 (10-20%) 下,CAP 在大多数模型基准配置中均优于 Wanda。 Llama-3 的 ARC-Challenge 收益尤其大。我们的结果表明,与同等稀疏度的相关剪枝标准相比,注意力头级因果归因可以更好地保持下游基准的推理性能,同时在 50% 稀疏度下仍然受到粗略 MLP 归因的限制。