论文

突破三值大模型的1.58位存储界线

Breaking the 1.58-bit Barrier for Ternary LLMs

模型优化模型压缩

摘要

三值大模型每个权重取−1、0、+1之一,通常参照信息论log₂3约1.585位每权重。常用部署将五个三值权重打包为一字节,实际采用二次幂分组后向上取整至1.625位,隐含三符号等概率。我们测量29个三值模型,发现零占比最高51.5%。据此提出简单分布自适应布局BITCOS,由密集存在位图和压缩符号向量组成,零密度为z时每权重成本为2−z位。29个测试模型中26个比五三值打包更紧凑,最稀疏模型达到1.485位。BITCOS适合现代处理器与GPU高效解包,我们提供AVX-512、AVX2和Intel Xe2 GPU优化序列。与生产级先进三值矩阵向量乘内核相比,在真实模型零密度下,布局收益最高1.28倍。最后在五种客户端及服务器CPU、集成及独立Xe2 GPU平台展示端到端推理,解码吞吐在CPU最高提高1.18倍,GPU最高1.27倍。