论文

BARQ:低位LLM量化的平衡码本细化

BARQ: Balanced Codebook Refinement for Low-Bit LLM Quantization

摘要

随着大语言模型(LLM)参数数量的增长,模型存储和参数记忆流量已成为高效部署的主要瓶颈。基于码本的权重量化降低了这些成本,但在拟合过程中不平衡的最近码字分配可能会导致某些码字更新不充分,从而限制码本的有效利用。为了解决这个限制,我们提出了量化的平衡分配细化(BARQ),它通过现有码本的平衡拟合来提高量化质量。具体来说,我们首先通过具有均匀边际和曲率加权重建成本的熵正则化最优传输来计算权重块和码字之间的联合软分配,确保精确解中每个码字的正拟合质量相等。然后,我们通过分配加权重心更新来细化码字,我们证明这最小化了固定分配的拟合目标。对于有限的 Sinkhorn 迭代,如果所有码字质量超过分母下限,则实现的更新将保留这种最优性。最后,我们放弃软分配并使用精炼码本进行标准硬最近码字编码,我们的分析为减少硬量化失真和评估损失建立了充分的条件。在多个LLM中,与可比比特预算下的评估基线相比,BARQ 实现了更低的困惑度和更高的平均零样本精度。代码可在 https://github.com/chenhangcuisg-code/BARQ. 获取

BARQ:低位LLM量化的平衡码本细化的原论文方法或结果图
图 2:BARQ 管道概述(VQ:矢量量化;MLP:多层感知器)。曲率感知成本:计算权重块和初始码字之间的距离,并设置分组熵温度。平衡熵 E 步:使用对数域 Sinkhorn 缩放来获得具有统一码字和块边缘的软分配。重心 M 步:将每个码字更新为块的分配加权重心。硬部署:丢弃传输状态并使用原始最近码字规则用精炼码本对权重进行编码。仅存储精炼码本和硬索引。