论文
CASK:面向推理轨迹的核心感知选择性KV压缩
CASK: Core-Aware Selective KV Compression for Reasoning Traces
摘要
在执行长程推理的大语言模型中,KV缓存随解码长度快速增长,造成内存与推理稳定性瓶颈。现有面向推理的KV压缩大多遵循以逐出为中心的视角:更准确地估计token重要性,然后丢弃排名较低的条目。我们的分析表明,仅靠改进打分器往往无法实质性重组实际保留集,因此可能不是保持推理行为的主要杠杆。我们转而将推理KV压缩构建为一个保持行为的结构化整合问题。CASK将解码期推理轨迹划分为锚定答案形成与中间状态的受保护核心,以及冗余度高的可合并草稿区。核心被完整保留,选择性整合只应用于草稿区。为应对前缀可能在解码阶段压缩生效前就耗尽预算的重提示场景,CASK进一步采用两阶段设计:先进行前缀逐出,再进行解码阶段整合。在H100推理门控上,CASK在匹配预算下于AIME24和AIME25上均显示出比TriAttention更高的全KV续写保真度,并反复出现 cask@384 > triattention@512 的交叉。在重提示回放中,multi_news和vcsum充当解码活跃的见证样本,而qmsum和gov_report暴露出 prefix_budget_exhausted 的边界。总体证据支持一个简单结论:有效的推理KV压缩与其说依赖更精细的打分器工程,不如说依赖将核心保留与选择性草稿整合相结合,以降低可用预算前沿。