论文

KL 量化镜头:混合精度 SSM-Transformer 模型的快速、仅前向灵敏度

A KL Lens on Quantization: Fast, Forward-Only Sensitivity for Mixed-Precision SSM-Transformer Models

摘要

在边缘设备上部署 大语言模型 (LLM) 面临着严格的计算和内存限制,限制了实时处理和设备上的智能。将结构化状态空间模型 (SSM) 与基于 Transformer 的 LLM 相结合的混合架构可实现效率和性能的平衡。积极的量化可以大幅缩小模型大小并加快推理速度,但其对不同组件的影响不均匀,需要仔细管理。在这项工作中,我们提出了一种轻量级、无反向传播、基于代理的灵敏度分析框架,以识别最容易受到量化引起的退化的混合 SSM-Transformer 组件。我们的方法仅依靠前向传递指标,避免了昂贵的梯度计算和再训练,使其适合由于专有限制或隐私约束而限制对域内数据的访问的情况。我们还提供了正式的分析,表明 Kullback-Leibler (KL) 散度度量比广泛采用的替代方案(例如均方误差 (MSE) 和信号量化噪声比 (SQNR))更好地捕获了语言建模任务的量化敏感性。通过对 SSM 和混合架构的广泛实验,我们的消融研究证实,基于 KL 的排名与观察到的性能下降一致,并且优于替代指标。该框架能够在资源受限的边缘设备上实际部署先进的混合模型,同时将精度损失降至最低。我们通过 Intel Lunar Lake 硬件上的真实设备上分析进一步验证了我们的方法,证明 KL 引导的混合精度可实现接近 FP16 的困惑度,其模型大小和吞吐量在 CPU 和 GPU 执行模式上都可与 Uniform INT4 相媲美。代码可在 https://github.com/jasonkongie/kl-ssm-quant 获取。