论文
QAPruner:多模态的量化感知视觉词元修剪 大语言模型
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
摘要
多模态 大语言模型 (MLLM) 显示出强大的推理能力,但其较高的计算和内存成本阻碍了在资源受限环境中的部署。虽然 后训练 量化 (PTQ) 和视觉词元修剪是标准压缩技术,但它们通常被视为独立优化。在本文中,我们表明这两种技术是强耦合的:天真地将基于语义的标记修剪应用于 PTQ 优化的 MLLM 可以丢弃对数值稳定性很重要的激活异常值,从而恶化低位状态下的量化误差(\textit{例如},W4A4)。为了解决这个问题,我们提出了一个量化感知的视觉词元修剪框架。我们的方法引入了一种轻量级混合灵敏度度量,它将模拟的分组量化误差与异常值强度相结合。通过将该指标与标准语义相关性分数相结合,该方法保留了语义信息丰富且对量化具有鲁棒性的标记。标准 LLaVA 架构上的实验表明,我们的方法始终优于朴素的集成基线。在仅保留 12.5% 视觉标记的激进剪枝率下,我们的框架将准确性比基线提高了 2.24%,甚至超过了无需剪枝的密集量化。据我们所知,这是第一个明确联合优化视觉标记修剪和 PTQ 以实现准确的低位 MLLM 推理的方法。