论文

StepKV:按推理步骤保留 Agent KV

StepKV: Step-Aware KV Cache Compression for LLM Agents

模型推理KV Cache

摘要

键值 (KV) 缓存对于高效自回归大语言模型 (LLM) 推理至关重要,但缓存会随着上下文长度线性增长,从而增加存储和解码成本。 KV 缓存压缩通过仅保留缓存词元的子集来减轻此成本。这一挑战对于多步骤 LLM 代理尤其重要,其中查询扩展到推理、工具交互和检索观察的轨迹。现有的修剪方法通常将缓存视为平面词元流,并根据新近度或注意力显着性对词元进行排名。这会造成压缩单元和推理单元之间的不匹配:词元级修剪会删除单个条目,而多步骤代理中的有用信息通常会被组织成重要性不均匀且延迟的推理步骤。因此,早期观察或中间决策可能近期很少受到关注,但对于以后的证据合成仍然至关重要。我们将这种故障模式称为“推理连续性”,这种 http URL 观察会激发 KV 缓存压缩,同时考虑词元级和推理步骤级信息。 StepKV 通过将推理步骤视为一流的保留单元来实现这一目标。它将缓存条目与其生成步骤相关联,从轨迹导出信号估计步骤效用,并将该效用与词元级显着性相结合。所得分数对可修剪词元进行全球排名,其中 StepKV 在目标预算下保留得分最高的条目。因此,StepKV 为代理 KV 缓存压缩提供了以步骤为中心的视角。在多跳 QA 和长范围网络推理任务中,StepKV 在低 KV 预算下保持准确性,其中词元级基线急剧下降,为多步代理推理提供更稳健的效率与准确性权衡。