论文
AdaVSkip:自适应视觉词元跨层跳跃以实现高效的 MLLM 推理
AdaVSkip: Adaptive Visual Token Skipping Across Layers For Efficient MLLMs Inference
摘要
多模态大语言模型 (MLLM) 需要大量计算来处理所有转换器层中的大量视觉标记。大多数有效 MLLM 推理的方法通过压缩视觉标记来利用水平冗余。除了减少词元之外,最近的研究还通过提前退出或固定层跳过来利用垂直冗余。然而,我们发现这种冗余的程度和分布因输入而异,并且自注意力模块和 MLP 模块之间也不同。受这些观察的启发,我们提出了 AdaVSkip,它为每一层配备了两个轻量级路由器,独立确定视觉标记是通过还是跳过自注意力和 MLP 模块。这些决策共同定义了特定于输入的视觉计算路径,但它们的离散和不可微分的性质使得学习有效路径具有挑战性。为了应对这一挑战,我们开发了一个渐进式两阶段训练框架,该框架仅更新路由器,同时保持主干网冻结。第一阶段通过监督训练建立初始路由策略,并使用从模块必要性分数得出的特定输入目标。为了进一步使路由策略与任务性能保持一致,第二阶段使用强化学习,通过生成答案的直接反馈来优化路由决策。它将答案正确性奖励与跳过一致性奖励结合起来,防止视觉标记计算的过度保留。在三个 MLLM 主干上,AdaVSkip 以大幅减少的计算量保持了强大的任务性能。在 LLaVA-NeXT-7B 上,AdaVSkip 将 FLOP 降低了 53.2%,同时保留了原始模型的平均性能。将其与视觉词元压缩相结合,可将这一降低幅度提高至 91.2%,同时平均保留原始性能的 97.2%。