论文

CurveTQ:以曲率加权搜索实现无需旋转的LLM权重量化

CurveTQ: Rotation-Free Trellis Quantization of LLM Weights via Curvature-Weighted Search

摘要

适用于大型语言模型的最佳两位权重量化器(例如 QTIP 和 Proteus)通过随机正交变换旋转每个权重矩阵,该变换必须在每个解码步骤中撤消,然后在欧几里德搜索下使用网格或格码对其进行编码; Hessian层仅通过编码块之间的误差反馈进入。我们证明这使得 Hessian 矩阵的一部分未被使用。误差反馈将损失转化为每个坐标舍入误差的加权和,其权重、Hessian LDL 分解的对角线、现有量化器会计算但从未读取。我们将这些权重放入维特比分支度量中,因此搜索遵循每个编码块内的曲率。这也解释了旋转:它消除了块内的变化,因此本地基础上的加权和旋转是替代品。在三个模型上,加权本机搜索与全维随机 Hadamard 的匹配与下游精度相差大约一个点,并且旋转后的加权几乎没有增益。围绕这个搜索,我们构建了 CurveTQ,一个没有旋转的网格编解码器,它通过因子尺度字段和封闭形式分位数表处理权重的幅度和边缘形状,并存储每个编码块的起始状态,以便网格可以适应误差反馈带来的残差。在三个 4-8B Instruct 模型上,在两位上,CurveTQ 的平均下游精度比 QTIP 和 Proteus 高 1-3 个点,即使在两者都给出了我们的启动状态之后,仅此一项就将任一基线提升了 1-3 个点。据我们所知,它还导致了 35B 专家的混合,这是此类模型的第一个网格编码结果。由于无需旋转来撤消,我们的解码器在所有测试的批量大小和位宽方面是这三种解码器中最快的。