EdgeRazor:通过混合精度量化感知的 大语言模型 的轻量级框架 蒸馏
EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation
摘要
量化已成为在资源受限设备上部署 大语言模型 (LLM) 的主流方法,但压缩精度低于 4 位通常会导致严重的性能下降或过高的再训练成本。在本文中,我们提出了 EdgeRazor,这是一种通过混合精度量化感知 蒸馏 实现 LLM 的轻量级框架。它包含三个模块:用于对位宽进行细粒度控制的混合精度结构量化、动态选择信息最丰富的特征进行对齐的层自适应特征 蒸馏 以及用于人工注释和蒸馏数据集上的前向反向平衡的熵感知 KL 散度。对 MobileLLM 和 Qwen 系列进行的评估表明,在权重激活量化下,1.88 位 Qwen3-0.6B-EdgeRazor 的性能优于最先进的 2 位基线 11.27,超出最强的 3 位基线 4.38,而量化的 MobileLLM-350M-EdgeRazor 需要训练预算比领先的量化感知训练方法低 4-10 倍。在效率方面,EdgeRazor 在所有位宽下都实现了更高的压缩比,1.58 位 Qwen3-0.6B-EdgeRazor 将存储空间从 1.11 GB 减少到 0.19 GB,同时解码速度比 16 位基线提高了 15.16$\times$。这些结果从经验上验证了 EdgeRazor 的有效性和效率。这些代码可以从 \href{https://github.com/zhangsq-nju/EdgeRazor}{GitHub} 和 \href{https://huggingface.co/collections/zhangsq-nju/edgerazor-nbit}{Huggingface} 访问。