论文
LBLLM:通过三阶段 蒸馏 对 大语言模型 进行轻量级二值化
LBLLM: Lightweight Binarization of Large Language Models via Three-Stage Distillation
摘要
在资源受限的环境中部署 大语言模型 (LLM) 会受到大量计算和内存需求的阻碍。我们提出了 LBLLM,一种轻量级二值化框架,通过新颖的三阶段量化策略实现有效的 W(1+1)A4 量化。该框架的流程如下:(1)通过PTQ初始化高质量的量化模型; (2) 通过逐层 蒸馏 量化二值化权重、分组位图和量化参数,同时保持激活的全精度; (3) 训练可学习的激活量化因子以将激活动态量化为 4 位。这种解耦设计减轻了权重和激活量化之间的干扰,从而产生更高的训练稳定性和更好的推理精度。 LBLLM 仅使用 0.016B 词元和单个 GPU 进行训练,在语言建模、常识 QA 和语言理解等任务中超越了 W2A4 量化设置上现有的最先进的二值化方法。这些结果表明,LLM 的极低比特量化既实用又高效,无需引入最近基于 PTQ 的工作中常用的任何额外高精度通道或旋转矩阵,为在资源有限的情况下高效部署 LLM 提供了一条有希望的途径。