论文

学习预测MLLM中的中层注意力以实现视觉token剪枝

Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Pruning

模型推理推理加速

摘要

多模态大语言模型(MLLM)在多样的视觉-语言任务上取得强劲表现,但其效率受限于处理大量视觉token的成本。视觉token剪枝可以降低这一成本,但需要准确的token重要性估计。近期研究表明,来自中间语言模型层的文本到视觉注意力可有效指导视觉token剪枝,通常的做法是用预定义中间层的注意力来选择要保留的视觉token。因此仍存在两个问题。首先,我们的分析显示,对问题最敏感的注意力层在不同样本间差异很大,使固定层成为次优选择。其次,从合适的中层获取注意力需要让大量视觉token穿过若干语言模型层,到那时相当多的计算已被消耗。为解决这两个问题,我们提出中层注意力预测(Middle-layer Attention Prediction, MAP),它使用问题对比教师选择(Question Contrastive Teacher Selection),通过对比原始问题与参考问题下的注意力来识别样本特定的教师层,并将所选层的注意力蒸馏到一个轻量预测器中,由该预测器从多模态输入特征估计视觉token重要性。在推理时,MAP将预测的重要性分数与多样性准则结合,在第一个语言模型层之前剪枝视觉token。因此,MAP剪枝无需注意力图,并与现有推理加速技术保持兼容。在LLaVA-NeXT-7B的十个基准上,MAP仅用5.56%的视觉token保留了未剪枝模型97.5%的性能,带来3.09倍端到端加速。

学习预测MLLM中的中层注意力以实现视觉token剪枝:论文配图
图4:MAP概览。