论文
HARD-KV:用于解码时 KV 压缩的头部自适应正则化
HARD-KV: Head-Adaptive Regularization for Decoding-time KV Compression
摘要
长上下文 LLM 推理面临着根本性冲突:头部自适应压缩算法(例如,Top-$p$ 核采样)通过动态波动的内存预算提供卓越的准确性,但现代推理引擎(例如 vLLM)需要严格的静态内存模式来利用 CUDA 图形和 PagedAttention。我们通过 HARD-KV 解决了这种“静态-动态”不匹配问题,HARD-KV 是一个统一的框架,可以将动态选择与严格的系统约束联系起来。 HARD-KV 引入了级联缓存层次结构,跨密集层、稀疏层和压缩层管理词元生命周期。至关重要的是,我们提出了一种 logits 校准机制,将不同的重要性指标标准化为统一的概率空间,从而实现跨异构头的一致的 Top-$p$ 预算。为了弥补效率差距,我们提供了系统级解决方案,它将碎片化的动态索引重写为与高性能推理引擎兼容的连续物理布局。关于数学推理基准(AIME、U-Math)的大量实验验证了 HARD-KV 与静态基线相比实现了高达 2倍的吞吐量改进,同时在 10k+ 词元场景中保持高保真度生成。代码可在 https://github.com/SuDIS-ZJU/HARDInfer 获取。