论文
NestedKV:用于长上下文 KV 缓存压缩的嵌套内存路由
NestedKV: Nested Memory Routing for Long-Context KV Cache Compression
摘要
长上下文语言模型受到键值 (KV) 缓存的内存占用的限制。现有的 无需训练 KV 压缩方法通常通过一个重要信号(注意力、新近度、分层分配或关键独特性)对标记进行排名,当有用的上下文具有全局独特性、局部情景性或直接相关性时,这些信号就会变得脆弱。我们介绍 NestedKV,这是一种受嵌套学习中的连续内存系统启发的仅键 KV 缓存压缩方法。 NestedKV 维护全局、块级和滑动窗口关键锚点,通过多时间尺度余弦异常对词元进行评分,并使用头部自适应混合和惊喜门控词元路由将结果排名与 无需训练 外部学习器相结合。该分数与自适应人均预算配对,无需训练或 LLM 修改。在 Qwen3 和 Llama-3.2 模型上的 RULER (4k--32k)、LooGLE、LongBench、LongBench-E、InfiniteBench 和 MMLU-Pro 中,当保留的缓存较小时,NestedKV 最强。在 Qwen3-4B 上,它在 RULER 上比 KeyDiff 提高了 19.10 点,在 LongBench 上提高了 19.29 点($r=0.75$);当 $r=0.95$ 时,它在 LongBench 上保留 37.32,而 KeyDiff 保留 17.55。