论文
RaBiT:面向准确高效LLM的残差感知二值化训练
RaBiT: Residual-Aware Binarization Training for Accurate and Efficient LLMs
摘要
大语言模型 (LLM) 的高效部署需要极端量化,迫使在低位效率和性能之间进行关键权衡。残差二值化通过堆叠二进制 ($\pm$1) 层来实现硬件友好、无 matmul 的推理,但受到病态特征协同适应的困扰。我们确定了一种关键的故障模式,我们将其称为路径间适应:在量化感知训练(QAT)期间,并行残差二进制路径学习冗余特征,从而降低误差补偿结构并限制模型的表达能力。虽然之前的工作依赖于限制解决方案空间的启发式解决方法(例如路径冻结),但我们提出了 RaBiT,这是一种新颖的量化框架,它通过算法强制执行残差层次结构来解决共同适应问题。其核心机制从单个共享的全精度权重中顺序导出每个二进制路径,这确保每个路径都能纠正前一个路径的错误。该过程通过稳健的初始化来稳定,该初始化优先考虑功能保留而不是单纯的权重近似。 RaBiT 重新定义了 2 位精度-效率前沿:它实现了最先进的性能,甚至可以与硬件密集型矢量量化 (VQ) 方法相媲美,并且比 RTX 4090 上的全精度模型提供 4.49 美元×$ 的推理加速。
