论文
通过事先校正的词元减少加速多模式 大语言模型
Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction
摘要
视觉词元减少已成为加速多式联运 大语言模型 (MLLM) 的有效策略。许多现有方法通过对文本视觉注意力分数进行排名来修剪标记。然而,我们表明注意力通常由模型引发的先验主导:即使没有文本指令,MLLM 也倾向于关注某些与任务无关的区域。因此,指令条件标记的注意力分数被抑制,增加了这些标记在修剪过程中被丢弃的风险。为了解决这个问题,我们提出了先验校正词元缩减(PriorTR),这是一种 无需训练 词元缩减方法,它明确地将任务条件注意力与模型引发的先验分开。 PriorTR 估计先验的注意力图,并将其与任务条件注意力分布进行对比,以测量每个视觉标记贡献的额外可用信息。重要的是,PriorTR 通过引入一个空标记来计算单个前向传递中的模型诱导先验和任务条件后验,该空标记充当注意块中与指令无关的探针。这种设计避免了重复传播。跨多个多模式基准和 MLLM 的大量实验表明,与强大的 无需训练 基线相比,PriorTR 持续改善了准确性和效率之间的权衡,特别是在激进的 词元预算 下。