论文

参与、转换或沉默:操作员级视觉跳跃以实现高效的多模态 LLM 推理

Attend, Transform, or Silence: Operator-Level Visual Skipping for Efficient Multimodal LLM Inference

模型推理推理加速

摘要

多模态 大语言模型 (MLLM) 越来越多地处理长视觉标记序列,从而增加整体推理计算。现有的加速方法通常会删除视觉标记或跳过整个层中的视觉标记更新,但这些粗略策略可能会丢弃细粒度的证据或抑制有用的运算符和冗余的运算符。在本文中,我们从答案可观察的角度研究视觉词元计算,并发现后期视觉词元更新可以保持很大,同时对答案词元表示影响很小。受这种答案沉默冗余的推动,我们将每个 Transformer 层分解为注意力和 FFN 运算符,并表明有用的视觉计算通常是运算符主导且依赖于层的。我们提出了一个操作员级别的视觉词元跳跃框架,该框架保留完整的视觉词元序列,同时选择性地绕过冗余注意力、FFN 或两者。跨三个 MLLM 架构和 10 个 VQA 基准测试的实验表明,我们的方法实现了强大的效率与准确性权衡,减少了 Qwen3-VL 上的 \textbf{33.7\%} TFLOP,同时保留了 \textbf{99.5\%} 的普通模型性能。