论文
TTKV:用于长上下文 LLM 推理的临时分层 KV 缓存
TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference
摘要
键值 (KV) 缓存对于 大语言模型 (LLM) 中的高效推理至关重要,但其内存占用量随上下文长度线性扩展,导致严重的可扩展性瓶颈。现有方法在很大程度上将 KV 状态视为在不同时间上同等重要,隐含地假设统一的精度和可访问性。然而,这种假设与人类记忆系统形成鲜明对比,人类记忆系统的记忆在清晰度、回忆频率以及与时间邻近性的相关性方面各不相同。受这一见解的启发,我们提出了 TTKV,一种 KV 缓存管理框架,它将人类记忆系统映射到 KV 缓存。 TTKV 将 KV 缓存划分为具有异构容量和精度的时间层。该设计解决了三个方面的问题:(1)Tier Layout,使用HBM和DRAM解耦快慢存储器; (2) Tier Content,根据时间接近度将更新的 KV 状态分配给更快、更高精度的层; (3)层交互,在访问慢速层时采用块式流注意来重叠通信和计算。实验表明,TTKV 在 128K 上下文任务上将跨层流量减少了 5.94 倍,与强基线相比,延迟减少了高达 76%,吞吐量提高了 2 倍。