论文
SchurQuant:分层 LLM 量化的分组离散优化
SchurQuant: Groupwise Discrete Optimization for Layer-Wise LLM Quantization
摘要
仅权重 后训练 量化 (PTQ) 可以在内存预算紧张的情况下部署 大语言模型,但精度通常会在 2-3 位时崩溃。现有的无反向传播 PTQ 优化器有两个局限性:群体决策忽略了剩余连续后缀可以吸收的校正,并且离散细化通常保持仿射量化网格固定。我们引入 SCHUROPT,它在分析上消除了后缀的最佳连续响应,产生具有 Schur 补曲率的精确群二次方程。然后,它使用整数代码上的坐标下降来交替封闭形式的行缩放/零点重新拟合。固定 GPTQ 目标后,SCHUROPT 将 2 位 Qwen3-4B 的平均零射击精度提高了 11.88 个百分点 (pp)。然而,在更高的精度下,更严格的重建并不能持续改善最终模型指标。因此,SCHURQUANT 将 SCHUROPT 与量化前缀教师重建、参考权重正则化、残差添加目标和教师决策词元加权相结合。在八个 Llama 和 Qwen 模型中,SCHURQUANT 在评估的无反向传播 PTQ 基线中实现了最高的平均零样本精度,在 2 位时比最强基线高 9.65 pp。