论文
迈向视觉语言模型的联合量化和词元修剪
Towards Joint Quantization and Token Pruning of Vision-Language Models
摘要
在积极的低位推理下部署视觉语言模型 (VLM) 仍然具有挑战性,因为推理成本主要由预填充期间的长视觉词元前缀和自回归解码期间不断增长的 KV 缓存决定。词元剪枝和低位量化对于降低这些成本是互补的,但由于量化校准和剪枝执行之间的不匹配,简单的分阶段组合通常很脆弱。我们提出了一个协作量化和修剪框架,它将低位推理和确定性视觉词元修剪统一在单个可部署的管道中。该框架引入了 \textbf{Q}uantization \textbf{U}nified \textbf{O}ffline \textbf{T}oken \textbf{A}llocator (\textbf{QUOTA}),它将低位校准信号转换为分层词元分配计划,并将其具体化为修剪配方。通过结合激活幅度、注意力线索和明确的低位风险信号,在部署的 W4A4 算子下通过量化 KV 缓存来评估词元重要性,从而实现一致的预算 top-$k$ 选择。标准 VLM 基准测试表明,在相同的低位机制下,与阶段式基线相比,鲁棒性得到了提高,实现了 95.65% 的平均保留率,同时仅保留了 30% 的视觉标记,而代表性阶段式组合的保留率约为 94.3%。代码将被发布。