论文
通过自适应注意力匹配进行推理的思想感知 KV 缓存压缩
Thought-Aware KV Cache Compaction for Reasoning via Adaptive Attention Matching
摘要
推理语言模型会生成冗长的思想链(CoT)序列,其键值(KV)缓存线性增长并成为解码过程中的内存瓶颈。现有的压缩方法将推理轨迹视为平面标记序列并应用统一压缩,忽略了 CoT 推理的层次结构,其中不同步骤的重要性差异很大。我们提出了 \textbf{思维感知注意力匹配(TAM)},它通过三种机制利用这种结构:(i)~将轨迹分解为推理块的思维分段,(ii)~根据每个片段的重要性和大小分配压缩预算的自适应预算分配,以及(iii)~保留高注意力推理锚点的关键词元保护。我们证明分配规则在凸误差模型下是最优的,并且顺序压缩下的累积误差仍然有界。使用 Qwen3-4B 在 AIME 2024 和 MATH-500 上进行的实验表明,在相同的内存占用量下,TAM 比均匀压缩提高了准确性,定期压缩将峰值内存限制为 3.1--3.2GB(减少了 65%),同时保持了有竞争力的准确性。