论文

使用加法码本对 LLM 进行多位宽量化

Multi-Bitwidth Quantization for LLMs Using Additive Codebooks

摘要

随着 大语言模型 (LLM) 越来越多地部署在具有不同资源限制的异构硬件上,无需重新训练即可自适应管理性能与效率权衡的能力至关重要。我们提出了 Drop-by-Drop,这是一种新颖的多位宽 后训练 量化框架,能够从单个量化模型对 LLM 权重进行推理时间精确控制。作为理论动机,我们证明高斯源在由 LLM 损失函数驱动的加权均方误差失真下是连续可细化的:跨失真级别的连续细化相对于每个级别的单独编码不会产生速率损失。 Drop-by-Drop 在实践中通过将俄罗斯套娃式监督纳入加性码本训练中来近似这种层次结构,从而引入一种排序,其中码本前缀在每个精度级别上产生准确的部分重建。此外,块哈达玛旋转使权重分布更接近我们的高斯源假设。结果是一个单一模型,通过删除码本来服务于多个位宽,相对于静态每位宽模型减少了存储和量化成本。在 Qwen、LLaMA、Gemma 和 Mistral 中,Drop-by-Drop 比最先进的多位宽方法实现了更低的复杂性,并具有具有竞争力的零样本精度,而我们的专用内核进一步减少了解码延迟。