论文
用于高效视觉语言模型推理的旋转对齐关键通道修剪
Rotation-Aligned Key Channel Pruning for Efficient Vision-Language Model Inference
摘要
视觉语言模型在推理时承受着严重的 KV 缓存压力,因为单个图像通常会编码成数千个标记。大多数现有方法通过词元修剪来利用词元稀疏性,但永久丢弃视觉内容会导致细粒度感知任务的严重退化。这激发了一个补充轴,即特征稀疏性:在固定的 KV 缓存预算下,压缩通道维度可以在相同的内存成本下保留更多的视觉标记。然而,Prior Key 通道剪枝方法面临结构性权衡:token-wise 通道剪枝富有表现力,但非结构化且缓慢,而 head-wise 方法对硬件友好,但鲁棒性较差。我们通过 RotateK 解决了这个问题,RotateK 是一个基于旋转的结构化关键通道修剪框架。 RotateK 应用基于 PCA 的在线旋转,将 token 相关的通道重要性对齐到共享的低维子空间中,从而能够在轻量级 head-wise mask 下进行准确的修剪;融合的 Triton 注意力内核直接对稀疏通道密钥进行操作,以实现高效解码。在两个代表性 VLM 主干上进行的实验表明,RotateK 在准确性和解码延迟方面始终优于先前的密钥通道修剪,而联合词元通道修剪在匹配的 KV 缓存预算下比仅词元基线有所改进。