论文

FAMPWQ:Fisher 基于信息的自适应混合精度权重量化,用于有效的 LLM 推理

FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference

摘要

近年来,大语言模型(LLM)在多个领域取得了令人瞩目的成就,而LLM过多的资源需求阻碍了在资源受限设备上的部署。尽管模型量化是一种有效的方法,但传统的量化方法通常会由于统一的位宽或简单的启发式灵敏度评估而导致严重的性能下降。在本文中,我们提出了一种新颖的基于 Fisher 信息的自适应混合精度权重量化方法,即 FAMPWQ,它执行层自适应权重量化,以在商用 GPU 上进行有效的 LLM 推理。首先,我们提出了一种具有新颖费舍尔信息度量的系统模型,以测量分层对量化的敏感性。其次,我们在 FAMPWQ 中提出了一种基于强化学习的位宽分配器,它生成基于 Fisher 信息敏感度度量的自适应位宽分配策略。对 7 个模型和 5 个基准进行的大量实验表明,FAMPWQ 在 PPL(最多小 3.39)、准确性(最多高 6.87%)和 LLM 作为法官比较(最多 76% 胜率)方面显着优于 7 个基线方法。