论文

CHESS:面向长上下文 LLM 推理的上下文感知分层高效语义选择

CHESS: Context-aware Hierarchical Efficient Semantic Selection for Long-Context LLM Inference

模型推理KV Cache

摘要

长上下文 LLM 要求在低延迟下实现准确推理,但随着上下文增长,解码主要受 KV 缓存制约。先前的剪枝方法大多与上下文无关:其 token 选择忽略逐步相关性与局部语义,损害质量。此外,其不规则的访问模式与选择开销只能带来有限的实际加速。为此,我们提出 CHESS,一个算法-系统协同设计的 KV 缓存管理系统。在算法层面,CHESS 引入上下文感知的分层选择策略,为当前解码动态重建连贯上下文。在系统层面,粗粒度选择消除了昂贵的数据搬运,将理论稀疏性转化为实际加速。大量评估表明,CHESS 仅用 1% 的 KV 缓存即超越 Full-KV 质量,以最高 4.56 倍的吞吐量实现低延迟稳定推理,并持续优于其他强基线。代码见 https://anonymous.4open.science/r/CHESS/。

CHESS:面向长上下文 LLM 推理的上下文感知分层高效语义选择
图4:每个 KV Cache 页的平均熵与 Varentropy 的分布(校准阶段)。该图展示来自校准数据集的页的密度,颜色越暖表示浓度越高。虚线表示所选的第 99 百分位阈值。右上方的阴影区域突出显示了被剪枝区域(pruned area),对应被我们方法排除的高不确定性离群点。