论文

QTEA:具有稀疏剩余显着权重和按列优化的三元 LLM

QTEA: Ternary LLMs with Sparse Residual Salient Weight and By-Column Optimization

摘要

仅权重 后训练 量化 (PTQ) 可以减轻大规模服务 大语言模型 (LLM) 的计算负担。然而,现有的 PTQ 方法通常无法跨模型泛化,并且会遭受严重的精度损失,低于 2 位。许多人利用非结构化稀疏性来减轻这种损失,但代价是规律性和 GPU 友好的执行。我们提出了 QTEA,一种亚 2 位 PTQ 框架,它将权重量化为三元值,并使用显着权重作为残差补偿器。为了保持硬件效率,残差被分配给选定的列,在显着列中具有半结构化的 $1:4$ 稀疏度。我们进一步将按列重新缩放细化添加到 GPTQ 样式的逐列量化中,交替更新每列尺度和三元分配以减少重建误差。我们还识别了 GPTQ 中与顺序相关的错误传播,并引入错误衰减来减弱后期错误累积。在 Qwen3-14B 上,QTEA 将所有权重压缩至有效的每个权重 1.7 位,同时将最强三元 PTQ 基线的平均准确度提高了 16.7%。它还在 WikiText 和 C4 上分别实现了 1.40$\times$ 和 2.61$\times$ 较低的困惑度。这一趋势在 Llama3-8B 上保持不变,其中 QTEA 在相同数据集上获得了 6.6% 的准确率增益和 1.34$\times$ / 1.95$\times$ 较低的困惑度。最后,我们开发了一个基于查找表的内核,与 FP16 基线相比,每个词元生成速度提高了 7.2 美元\倍$。代码可在 https://github.com/Intelligent-Microsystems-Lab/QTEA 获取。