论文

MM-ShiftKV:面向多模态大语言模型的解码感知预填充阶段 KV 选择

MM-ShiftKV: Decode-Aware Prefill-Stage KV Selection for Multimodal Large Language Models

模型推理KV Cache

摘要

键值(KV)缓存对多模态大语言模型(MLLM)的高效推理至关重要,但其内存占用随上下文长度线性增长,并因视觉 token 数量庞大而成为主要瓶颈。近期的预填充阶段 KV 选择方法从预填充统计量估计 KV 重要性,隐含假设预填充时的查询能够代表解码阶段遇到的查询。我们证明这一假设在多模态推理中会失效:解码时查询的方差显著大于预填充阶段表征,导致在紧凑缓存预算下 KV 重要性估计不稳定。因此,微小的排序误差就可能不成比例地丢弃语义上关键的视觉 token,损害锚定与推理性能。我们提出 MM-ShiftKV,一种免训练、解码感知且严格仅限预填充阶段的 KV 选择方法。MM-ShiftKV 通过构建方差扩展的查询代理,在预填充期间近似解码时查询行为,并基于其聚合注意力质量估计提示 KV 重要性。在多模态基准上的实验表明,MM-ShiftKV 在严格的 KV 缓存预算下持续优于现有方法。代码见 https://github.com/zjuDBxAI/MM-ShiftKV。

MM-ShiftKV:面向多模态大语言模型的解码感知预填充阶段 KV 选择:论文配图
图 2:MM-ShiftKV 概述。该方法计算当前输入的完整预填充序列的统计数据,并在预填充期间构造方差扩展、解码感知的查询代理。这些查询代理用于通过注意力质量聚合和使用最后一个标记锚点进行分组投票来估计即时 KV 重要性,从而在固定预算下产生紧凑的 KV 缓存。