论文
CHESS:面向长上下文 LLM 推理的上下文感知分层高效语义选择
CHESS: Context-aware Hierarchical Efficient Semantic Selection for Long-Context LLM Inference
摘要
长上下文 LLM 要求在低延迟下实现准确推理,但随着上下文增长,解码主要受 KV 缓存制约。先前的剪枝方法大多与上下文无关:其 token 选择忽略逐步相关性与局部语义,损害质量。此外,其不规则的访问模式与选择开销只能带来有限的实际加速。为此,我们提出 CHESS,一个算法-系统协同设计的 KV 缓存管理系统。在算法层面,CHESS 引入上下文感知的分层选择策略,为当前解码动态重建连贯上下文。在系统层面,粗粒度选择消除了昂贵的数据搬运,将理论稀疏性转化为实际加速。大量评估表明,CHESS 仅用 1% 的 KV 缓存即超越 Full-KV 质量,以最高 4.56 倍的吞吐量实现低延迟稳定推理,并持续优于其他强基线。代码见 https://anonymous.4open.science/r/CHESS/。
