论文
用于 KV 缓存压缩的子词元路由
Sub-Token Routing for KV Cache Compression
摘要
Transformer 推理通常需要大型 KV 缓存,特别是对于长上下文语言建模和多模态生成。现有的压缩方法通常通过选择、驱逐、量化或压缩缓存的词元,或者通过在语言模型推理之前减少视觉词元序列来降低缓存成本。我们引入了子词元路由,这是一种 KV 压缩方法,可在保留的词元内添加更精细的控制轴。它将每个保留值向量分成组并仅保留选定的组,同时保持查询和键状态不变。该方法设计为在 词元级 还原后起作用。首先,词元减少方法确定保留哪些词元。然后,子词元路由压缩这些保留词元内的值状态。匹配 KV 预算下的实验表明,添加子词元路由可提高 LLM 和 VLM 设置中的 词元级 缩减性能,包括 LLaMA-2-7B 和 Qwen2.5-7B 上的 Quest,以及跨 LLaVA 和 Qwen-VL 模型的 FastV/VisionZip。 KV 预算越小,收益越大,这表明当进一步删除词元成本高昂时,值组路由特别有用。总体而言,词元级 缩减和子词元路由提供了降低 KV 成本的互补方法。