论文
SeKV:分层语义记忆支持长上下文KV缓存按需恢复
SeKV: Resolution-Adaptive KV Cache with Hierarchical Semantic Memory for Long-Context LLM Inference
摘要
长上下文LLM的KV缓存随序列长度线性增加,并需在解码全程保留,成为显存瓶颈。词元驱逐会丢失信息,预填充时固定的语义分组也无法在生成需要某片段时恢复词元细节。SeKV按熵引导的语义片段组织上下文,在GPU与CPU层级存储中保留信息:GPU保存轻量摘要向量用于粗路由,CPU保存低秩SVD基以按需重建词元。训练的放大机制在解码时选择展开与查询相关片段,无需在GPU物化完整KV缓存。基础LLM完全冻结,新增可训练参数少于0.05%。四项基准中,相比最强语义压缩基线平均改善5.9%;128K上下文下,相比完整KV缓存GPU显存减少53.3%。代码:https://github.com/AmirAbaskohi/SeKV。