论文

一切为了 1 位:迈向真正的 1 位 后训练 LLM 量化

All for 1-Bit: Towards Genuine 1-Bit Post-Training Quantization for LLMs

摘要

大语言模型(LLM)取得了显着的进步,但其海量存储和内存带宽需求仍然阻碍了高效部署。权重二值化是一种很有前途的解决方案,但由于隐藏的开销,现有的基于二值化的 后训练 量化 (PTQ) 方法通常远远超过标称的 1 位存储目标。为了解决这一差距,我们提出了 All for 1-Bit (AF1),这是 LLM 的真正 1 位 PTQ 框架。 AF1 包含两个互补的组件:(1) 零空间感知二元分解 (NABF),用于通过 Hessian 感知代理重参数化、零空间感知二元分解和仅尺度全局重构来改进二元重构; (2) 分层 Shapley 分配 (HiSA),用于使用分层 Shapley 灵敏度分配结构容量。它们共同在 PTQ 设置中严格的 1.0-BPW 预算下保持模型准确性。 LLaMA、Qwen 和 Gemma 系列的实验表明,AF1 在困惑度和零样本精度方面始终优于现有的基于二值化的 PTQ 方法。与 BF16 相比,AF1 在评估的模型中实现了平均 2.5 倍的推理加速和超过 90% 的内存减少,为 LLM 提供了可部署的真正 1 位压缩的实用路径。可重复性的代码可在 https://github.com/Kishon-zzx/AF1 上找到。