用于积极量化的 Recover-LoRA:通过对合成数据进行 知识蒸馏 的低秩适应来恢复 2 位语言模型的准确性
Recover-LoRA for Aggressive Quantization: Reclaiming Accuracy in 2-Bit Language Models via Low-Rank Adaptation with Knowledge Distillation on Synthetic Data
摘要
积极的权重量化至 2 位精度可为 大语言模型 (LLM) 推理提供可观的吞吐量和内存增益,但通常会导致严重的精度下降。这些收益与边缘和设备上部署尤其相关,其中内存容量和带宽是主要限制。在这项工作中,我们将 Recover-LoRA(一种最初为一般模型权重损坏而开发的轻量级、无数据精度恢复方法)扩展到超低位量化的设置。我们提出了一种选择性混合精度策略,其中仅 MLP 的门和上投影层被量化为 2 位(W2),而所有其他线性层保持更高的精度,从而产生混合精度 GateUp 配置。我们通过对三个模型系列 (4B--20B) 和两个硬件平台的屋顶线分析证明,W4/W2-GateUp 部署(4 位基础,2 位门/向上)比统一 W4 提供 7.5--23.3% TPS 改进,具体取决于模型和上下文长度,同时将量化误差限制在可预测的层子集。然后,我们应用 Recover-LoRA——通过 logits 蒸馏 使用合成数据在量化层上训练低秩适配器——以恢复门层和上层的 2 位量化所损失的精度。在 Qwen3-4B 的案例研究中,Recover-LoRA 在 12 个基准测试中的 9 个上实现了 80--95% 的准确度恢复,仅使用 10k 合成训练样本且没有标记数据。我们进一步证明,对于基于 蒸馏 的恢复,合成数据的性能与精选的标记数据相当,并且该恢复可推广到分布外评估任务。我们的结果表明 Recover-LoRA 作为一种实用的量化后精度恢复工具,可在部署设置中进行积极的权重压缩。