论文
LAQuant:一种简单的无开销大型推理模型,通过分层前瞻损失进行量化
LAQuant: A Simple Overhead-free Large Reasoning Model Quantization by Layer-wise Lookahead Loss
摘要
大型推理模型 (LRM) 通过长自回归解码达到竞赛级别的数学和编码精度,使得每个词元解码成本成为主要的部署问题。权重量化是加速的标准工具,但代表性的方法——包括最先进的端到端(E2E)QAT——尽管保留了困惑度和短解码精度,但在长解码推理基准上失去了准确性。通过系统的梯度方向分析,我们确定了导致这一差距的两个因素:(i)QAT 损失下的 KV 缓存保真度保留,E2E 监督通过 softmax Fisher 指标衰减; (ii) 校准数据和部署分布之间的 Hessian 子空间对齐。我们提出了 LookAhead Quantization (LAQuant),这是一种分层的仅权重 QAT 方法,通过将推理域校准与单层 Lookahead 损失相结合来解决这两个因素,而无需在线转换开销,单层 Lookahead 损失的隐式跨层自适应保留了下一层残差流。对于 W3G128 量化下的 Qwen3-4B,LAQuant 将 AIME25 Pass@1 比 ParoQuant 提高了 15.11pp(在匹配校准时比 ParoQuant++ 提高了 1.93pp),同时在 RTX A6000 上实现了 FP16 的 3.42 倍解码加速(相比之下,ParoQuant 的解码速度为 3.01 倍)。