论文
StructKV:保留结构骨架以实现可扩展的长上下文推理
StructKV: Preserving the Structural Skeleton for Scalable Long-Context Inference
摘要
随着大语言模型(LLM)扩展到支持超过100万个词元的上下文窗口,键值(KV)缓存的线性增长带来了严重的内存容量和带宽瓶颈,限制了长上下文推理的效率。现有的压缩方法通常根据局部显着性度量对词元进行优先级排序,以将预填充计算与解码存储器分离。然而,这些方法通常依赖于特定层的本地显着性快照,从而系统地丢弃充当跨网络深度的全局信息中心但在选择用于修剪的特定层暂时休眠的词元。为了解决这个限制,我们提出了 StructKV,一种结构感知的 KV 缓存压缩框架,它引入了三个核心创新:首先,全球度中心性聚合整个网络深度的注意力模式,以识别全球信息中心。其次,动态枢轴检测利用信息论度量来自适应地定位最佳压缩层。最后,结构传播和解耦将计算预算与内存存储预算分开。 LongBench 和 RULER 基准测试的实验结果表明,StructKV 有效地保留了远程依赖性和检索鲁棒性。