论文
CAT-Q:LLM 的经济高效且准确的三元量化
CAT-Q: Cost-efficient and Accurate Ternary Quantization for LLMs
摘要
在本文中,我们提出了 CAT-Q,即经济高效且准确的三元量化,用于压缩和加速 LLM。现有最先进的三元量化方法依靠数据密集型和昂贵的量化感知训练来缓解严重的性能下降,CAT-Q 是一种简单而有效的 后训练 量化方案,可轻松应用于具有不同架构和模型大小的 LLM。它有两个关键组件,可学习调制(LM)和软三元化(ST),它们从优化的角度耦合在一起。 LM 利用可学习因素的组合来调节预训练的高精度权重和三元阈值的分布,从而使它们对三元化不太敏感。 ST进一步引入了可微的过渡函数来引导三值化过程趋于稳定收敛。我们表明,对于具有 1.7B 到 8B 参数的预训练 LLM,CAT-Q 可以仅使用 512 个校准样本将它们有效地量化为三元模型,同时实现比使用 100B 词元训练的开创性 BitNet 1.58 位 v1 和 v2 系列(具有 1.3B 到 7B 参数)更好的性能,从而将训练量减少约 100,000 倍词元。此外,我们首次证明 CAT-Q 可以在 8 个 A100-80GB GPU 上在短短 8 到 60 小时内将具有 14B 到 235B 参数的更大的预训练 LLM 量化为领先的三元模型。代码可在 https://github.com/IntelChina-AI/BitTern 获取。