论文

IntentKV:用于代理推理的跨回合意图感知 KV 缓存修剪

IntentKV: Cross-Turn Intent-Aware KV Cache Pruning for Agent Inference

模型推理KV Cache

摘要

多轮 LLM 代理将短查询扇形为工具调用、搜索结果和中间推理的长轨迹。 KV 内存和 KV 读取带宽在单个轨迹上都按数量级增长,使得键值 (KV) 缓存(而不是参数计算)成为长视野代理的主要服务瓶颈。我们引入 IntentKV,学习 KV 剪枝,使基础 LLM 保持冻结。 IntentKV 维护交叉转弯意图的会话级 QueryMemory,使用内存注意力规则对实时历史标记进行评分,并在当前查询 K 向量上添加具有交叉注意力的零初始化残差头。为了保持与前缀缓存的可组合性,逐出是一种槽映射重定向:丢弃的位置路由到哨兵死槽,同时幸存的 K/V 行、RoPE 阶段和槽标识保持原位。 IntentKV 与无修剪全缓存基准相匹配,在 KV 预算紧张的情况下几乎没有精度下降:在 8k KV 预算下,Qwen3-8B 上的平均峰值请求词元下降了 23.9%,Qwen2.5-14B 上的平均峰值请求词元下降了 30.7%。在所有方法在 Qwen2.5-14B 上完成的 100 个最长的 BCP 查询中,IntentKV-8k 进一步将最坏情况的峰值请求词元从 92.3k 减少到 20.5k,减少了 77.8%,将最坏情况的原始 KV 读取从 411M 减少到 31M,减少了 92.6%。