论文
CONF-KV:具有混合精度存储的置信度 KV 缓存驱逐,适用于长期 LLM
CONF-KV: Confidence-Aware KV Cache Eviction with Mixed-Precision Storage for Long-Horizon LLM
摘要
长期 LLM 推理将键值 (KV) 缓存转变为主要的 GPU 内存消耗者,并使每个词元的注意力变得越来越昂贵。许多常见的驱逐策略使用静态新近度窗口或历史注意力,从而留下未使用的在每个解码步骤上计算的信号:模型的当前不确定性。我们引入 CONF-KV,一种 KV 缓存管理器,它将下一个词元分布转换为标量置信度得分,并使用它来选择每步缓存预算,在模型不确定时保留更多上下文,并在模型有信心时积极修剪。在每个预算中,词元根据累积的注意力质量和新近度的综合排名,而受保护的最近窗口保留了局部一致性。我们将该策略与块式在线 softmax 注意力、混合 FP16/INT8 存储和金字塔每层预算变体相结合。在四个模型系列和生成的高达 4K 的长度中,CONF-KV 保持在固定的 512 个词元滑动窗口的足迹附近,同时保持在完整 KV 的 1.5--2.1 困惑点之内。在大海捞针多达 32K 个 token 上,CONF-KV 的检索准确率达到 91.4%,而滑动窗口为 53.8%,H2O 为 80.6%;在 75 个 VisualWebArena 任务中,它在峰值内存降低 2.8 倍的情况下保留了 95.3% 的全 KV 成功率。