论文
FluxBin:通过算法-内核协同进行灵活的基于 LUT 的超低位 LLM 推理
FluxBin: Flexible LUT-based Ultra-low-bit LLM Inference by Algorithm-Kernel Synergy
摘要
虽然二进制量化理论上可以为 大语言模型 (LLM) 提供极致的压缩和加速,但现有的研究往往忽视了专用硬件内核的必要性,因此由于持续依赖昂贵的浮点运算或运行时反量化开销而无法释放全部加速潜力。为了弥补这一差距,我们提出了 FluxBin(\textbf{F}lexible \textbf{L}UT-based \textbf{U}ltra-low-bit e\textbf{X}ecution with \textbf{Bin}ary bases),这是一种算法内核协同设计,可将 后训练 量化与高度优化的 CUDA 内核相协同。在算法上,我们引入解耦行列二元分解来增强表示能力,同时保持硬件效率,并辅以 Hessian 引导的显着性感知混合基来保留关键信息。在内核级别,我们采用尺度融合实现查找表构建方法来减少浮点运算,并采用虚拟列映射将不规则、稀疏和显着矩阵转换为密集执行。广泛的评估表明,FluxBin 在不同的模型架构中实现了高达 5.92 美元的加速和 10.19 美元的能源节省,提供了与经过严格微调的方法相当的精度。这有效地实现了在单个 A100 GPU 上部署 70B 规模的模型,并减少了 4 倍的内存。代码可在 https://github.com/nicyyyy/FluxBin 获取。