论文

RaBiT:面向准确高效LLM的残差感知二值化训练

RaBiT: Residual-Aware Binarization Training for Accurate and Efficient LLMs

摘要

大语言模型 (LLM) 的高效部署需要极端量化,迫使在低位效率和性能之间进行关键权衡。残差二值化通过堆叠二进制 ($\pm$1) 层来实现硬件友好、无 matmul 的推理,但受到病态特征协同适应的困扰。我们确定了一种关键的故障模式,我们将其称为路径间适应:在量化感知训练(QAT)期间,并行残差二进制路径学习冗余特征,从而降低误差补偿结构并限制模型的表达能力。虽然之前的工作依赖于限制解决方案空间的启发式解决方法(例如路径冻结),但我们提出了 RaBiT,这是一种新颖的量化框架,它通过算法强制执行残差层次结构来解决共同适应问题。其核心机制从单个共享的全精度权重中顺序导出每个二进制路径,这确保每个路径都能纠正前一个路径的错误。该过程通过稳健的初始化来稳定,该初始化优先考虑功能保留而不是单纯的权重近似。 RaBiT 重新定义了 2 位精度-效率前沿:它实现了最先进的性能,甚至可以与硬件密集型矢量量化 (VQ) 方法相媲美,并且比 RTX 4090 上的全精度模型提供 4.49 美元×$ 的推理加速。

RaBiT:面向准确高效LLM的残差感知二值化训练
图1:RaBiT训练框架概览。(a) 动态计算过程:在训练期间,二值路径从共享权重 𝐖 FP \mathbf{W}_{\mathrm{FP}} 动态导出,以强制形成残差层次结构。(b) 前向传播:在推理时,这些路径并行执行,以实现无matmul的高效率。(c) 反向传播:来自损失 ℒ \mathcal{L} 的梯度同时更新可学习的缩放因子 ( 𝐠 i , 𝐡 i \mathbf{g}_{i},\mathbf{h}_{i} ) 和共享的 𝐖 FP \mathbf{W}_{\mathrm{FP}} 。