论文

TWLA:通过 后训练 量化实现 LLM 的三元权重和低位激活

TWLA: Achieving Ternary Weights and Low-Bit Activations for LLMs via Post-Training Quantization

摘要

大语言模型 (LLM) 表现出卓越的通用语言处理能力,但其内存和计算成本阻碍了部署。三元化已成为一种有前景的压缩技术,可显着降低模型大小和推理复杂性。然而,现有方法难以应对重尾激活分布,因此保持激活的高精度,从根本上限制了端到端推理加速。为了克服这个限制,我们提出了 TWLA,一种 后训练 量化(PTQ)框架,它实现了 1.58 位权重压缩和 4 位激活量化,同时保持高精度。 TWLA 包含三个部分:(1)欧几里德到流形非对称三元量化器(E2M-ATQ)通过从欧几里德初始化到流形重定位的两阶段优化,最小化权重三元化下的层输出误差; (2)克罗内克正交三模态整形(KOTMS)应用克罗内克结构的正交旋转将权重重塑为三元友好的三模态分布,而共享旋转在统计上抑制了激活异常值; (3)层间感知激活混合精度(ILA-AMP)在比特分配中明确引入相邻层二阶交互成本,并联合优化共享正交变换引起的激活量化增益的逐层差异,防止由少数弱层触发级联。大量实验表明,TWLA 在 W1.58A4 下保持高精度,同时提供显着的推理加速。该代码可在 https://github.com/Kishon-zzx/TWLA 获取。