不要浪费比特!用于轻量级设备上的自适应 KV 缓存量化 LLM
Don't Waste Bits! Adaptive KV-Cache Quantization for Lightweight On-Device LLMs
摘要
大语言模型 (LLM) 在推理、生成和决策任务方面取得了显着的进步,但将它们部署在移动、嵌入式和边缘设备上仍然特别具有挑战性。设备上 LLM 推理受到键值 (KV) 缓存的内存和带宽开销的严重限制,该开销随上下文长度线性增长,并且通常主导解码成本。现有的 KV 缓存量化方案通常依赖于固定精度或手工设计的启发式方法,从而在低影响词元上浪费比特,同时过度压缩信息丰富的词元,从而导致本可以避免的精度下降。受霍夫曼编码的可变长度分配原理的启发,我们提出了自适应 KV 缓存量化,这是一种学习策略,可以按比例分配与词元重要性成比例的位宽,从而在不牺牲竞争准确性的情况下最大限度地减少预期内存和延迟。我们的框架提取轻量级的 词元级 特征,包括词元频率、质量得分、注意力方差和基于熵的不确定性,并将它们输入到紧凑的数据驱动控制器中,该控制器在解码过程中从 {2 位、4 位、8 位、FP16} 动态选择 KV 精度。与静态 KV 量化和基于规则的基线相比,这种自适应精度策略减少了 KV 内存占用和延迟,同时提高了准确性,并在标准 LLM 基准测试中保持接近 FP16 推理的竞争准确性。使用 SmolLM-135M、SmolLM-360M 和 SmolLM-1.7B 在多个常识推理基准上进行的广泛实验表明,我们的控制器持续改善了准确性与延迟之间的权衡。例如,在 HellaSwag 上使用 SmolLM-360M,我们的方法相对于静态 KV 量化将解码延迟(毫秒/词元)减少了 17.75%,将精度提高了 7.60 个点,并且与 FP16 推理相比仅保持在 0.30 个点以内。