论文
MM-ShiftKV:面向多模态大语言模型的解码感知预填充阶段 KV 选择
MM-ShiftKV: Decode-Aware Prefill-Stage KV Selection for Multimodal Large Language Models
摘要
键值(KV)缓存对多模态大语言模型(MLLM)的高效推理至关重要,但其内存占用随上下文长度线性增长,并因视觉 token 数量庞大而成为主要瓶颈。近期的预填充阶段 KV 选择方法从预填充统计量估计 KV 重要性,隐含假设预填充时的查询能够代表解码阶段遇到的查询。我们证明这一假设在多模态推理中会失效:解码时查询的方差显著大于预填充阶段表征,导致在紧凑缓存预算下 KV 重要性估计不稳定。因此,微小的排序误差就可能不成比例地丢弃语义上关键的视觉 token,损害锚定与推理性能。我们提出 MM-ShiftKV,一种免训练、解码感知且严格仅限预填充阶段的 KV 选择方法。MM-ShiftKV 通过构建方差扩展的查询代理,在预填充期间近似解码时查询行为,并基于其聚合注意力质量估计提示 KV 重要性。在多模态基准上的实验表明,MM-ShiftKV 在严格的 KV 缓存预算下持续优于现有方法。代码见 https://github.com/zjuDBxAI/MM-ShiftKV。
