论文
CateKV:论长上下文 LLM 推理加速的顺序一致性
CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration
摘要
大语言模型 (LLM) 在处理长上下文任务方面表现出了强大的能力,但由于大量的内存需求和推理延迟,处理如此长的上下文仍然具有挑战性。在这项工作中,我们发现某些注意力头在其注意力模式中表现出顺序一致性,这可以使用基于变异系数的算法持续识别。受这一观察的启发,我们提出了 CateKV,一种混合 KV 缓存方法,仅保留一致头的关键词元信息,从而减少 KV 缓存大小和计算开销,同时保留自适应头中的大部分 KV 对以确保高精度。我们展示了我们的算法的独特特征及其对现有加速方法的扩展。对长上下文基准的综合评估表明,在保持与完全注意力相当的准确性的同时,CateKV 在单样本输入中将内存使用量减少了高达 $2.72\times$,并将解码速度提高了 $2.18\times$,并在批处理场景中将吞吐量提高了 $3.96\times$。