论文

BWLA:打破 W1AX 后训练 量化 LLM 的障碍

BWLA: Breaking the Barrier of W1AX Post-Training Quantization for LLMs

摘要

大语言模型 (LLM) 推动了 NLP 的重大进展,但其大量的内存和计算需求仍然阻碍了实际部署。二值化可以将权重压缩到 1 位,从根本上降低计算和带宽成本。然而,现有方法无法解决激活重尾问题,因此必须保持激活的高精度,从而阻碍真正的端到端加速。为了克服这一限制,我们提出了 BWLA(二值化权重和低位激活),这是第一个 后训练 量化框架,它在实现 1 位权重量化和低位激活(例如 6 位)的同时保持高精度。正交克罗内克变换 (OKT) 通过 EM 最小化学习正交映射,将单峰权重转换为对称双峰形式,同时抑制激活尾部和不连贯性。然后,近端 SVD 投影 (PSP) 通过近端 SVD 投影执行轻量级低秩细化,以最小的开销进一步增强可量化性。在 Qwen3-32B 上,BWLA 在 6 位激活下达到 Wikitext2 困惑度 11.92(相比之下,SOTA 为 38),将五个零样本任务改进了 70% 以上,并提供 3.26 倍的推理加速,展示了现实世界 LLM 压缩和加速的强大潜力。