论文
AvoKV-E:面向长推理的载荷感知KV驱逐
AvoKV-E: Payload-Aware KV Cache Eviction for Long Reasoning
摘要
长输出推理把KV缓存瓶颈从固定提示转移到生成轨迹。既有推理缓存驱逐方法大多把缓存条目当路由对象:估计旧键是否仍会被读、会否重现、能否替换。这种纯路由视角忽视两个效应:低注意力条目可携带大值载荷,删除它们会改变未来预测;新生成的状态可能在后续查询有机会读取之前就显得"过时"。我们提出AvoKV-E——训练自由的驱逐策略:先延迟近期状态的资格,再用候选归一化读取压力、键冗余与值载荷潜力对合格条目排序。跨不同模型与数据集的实证评估显示:在匹配活跃KV预算下AvoKV-E匹敌或超越冗余感知、基于重现与思维自适应的驱逐基线,最大增益出现在最紧缓存状态。组件与反事实分析进一步把这些增益联系到延迟观测、载荷感知打分、冗余与尺度鲁棒归一化。结果共同表明:长推理的KV驱逐不仅要保留可能被读取的键,还要保留维持推理轨迹的值载荷。