论文

ProxyKV:跨模型代理剪枝,实现高效的长上下文 LLM 推理

ProxyKV: Cross-Model Proxy Pruning for Efficient Long-Context LLM Inference

模型推理KV Cache

摘要

大语言模型(LLM)中的高效长上下文推理受到键值(KV)缓存墙的严重限制,但现有的修剪方法迫使人们在牺牲精度的低延迟启发式方法和会产生过高预填充开销的高精度重建方法之间做出选择。为了弥补这种评分成本准确性差距,我们提出了 ProxyKV,这是一种跨模型代理修剪框架,它将重要性评分卸载到与大模型目标异步执行的轻量级内部小模型代理。为了弥合异构模型之间的架构差距,我们设计了 HybridAxialMapper,它将时间特征提取与十字头对齐分开,并结合多粒度混合损失,将学习目标从刚性回归转变为相对排名一致性。在 Llama-3.1、Qwen-2.5 和 Qwen-3 系列中,Llama-3.1、Qwen-2.5 和 Qwen-3 系列的目标参数从 LongBench、SCBench 和 RULER 上的 7B 到 32B 不等,ProxyKV 总体上与 KVZip 相匹配(恢复了平均准确度的 $\sim$$98.7\%$),同时在 Llama-3.1-8B 上提供高达 $3.21\times$ 的预填充加速(双 GPU;$\sim$$1.5\times$ 共享单 GPU)并在 Qwen-2.5-7B 上维持高达 170k 词元的上下文加速。