论文

STaR-KV:GUI 视觉语言模型中 KV 缓存压缩的时空自适应重新加权

STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models

模型推理KV Cache

摘要

基于视觉语言模型的图形用户界面 (GUI) 代理已显示出广泛的自动化功能,但部署受到随交互步骤线性增长的键值 (KV) 缓存的瓶颈。例如,UI-TARS-1.5-7B 仅在 5 个屏幕截图中就消耗了 76 GB 的 GPU 内存,接近主流 80 GB 加速器的容量。现有的 KV 压缩方法共享两个结构假设:将视觉标记重要性聚合到单个共享显着性图中,并对融合分数分布应用固定的 top-B 截止值。试点测量反驳了这两点:空间专业化存在于注意力子空间级别并跨层迁移,而分数分布的形状沿着轨迹漂移。我们提出了 STaR-KV(时空自适应重新加权),这是一种 无需训练 KV 缓存压缩框架,可沿三个轴校准词元重要性:(i)由在线空间互信息驱动的子空间感知评分; (ii) 时间稳定性折扣,抑制来自持续参与子空间的冗余缓存条目; (iii) 自适应地重塑分数分布的熵导出温度。在四个 GUI 基准测试中,STAR-KV 在匹配的预算下实现了最先进的 KV 压缩方法(例如 GUIKV、SnapKV)中最强的平均精度,没有压缩阶段 FLOP 开销 (-0.07%),并且在 20% KV 缓存预算下将峰值 GPU 内存削减了近 40%。代码可在 https://github.com/kawhiiiileo/STaR-KV 获取。