论文

StepPrune:跨多模态大语言模型的自适应顺序视觉标记选择

StepPrune: Adaptive Sequential Visual Token Selection across Multimodal Large Language Models

模型推理推理加速

摘要

视觉前缀占多模态大型语言模型(MLLM)中每层计算的主要部分,使得视觉标记修剪成为加速推理的直接方法。现有的 top-K 方法通常独立评估标记,并对所有输入应用统一的预算,忽略了依赖于选择的交互以及样本之间视觉复杂性的变化。相比之下,我们提出了 StepPrune,它将视觉标记修剪制定为自适应顺序决策过程。以先前选择的标记和文本上下文为条件,StepPrune 逐步构建保留的子集,并通过学习的 STOP 操作自动确定其大小。在训练期间,保留方差的噪声门为离散选择过程提供了可微分的代理,而在推理期间,未选择的标记在语言模型预填充之前被物理删除。分组选择机制进一步将 StepPrune 扩展到高分辨率输入。 LLaVA-1.5、LLaVA-NeXT、Qwen2.5-VL 和 InternVL3 的实验表明,StepPrune 在 LLaVA-1.5、Qwen2.5-VL 和 InternVL3 上的所有评估剪枝率中实现了最佳平均归一化性能保留,同时在 LLaVA-NeXT 的更长 AnyRes 前缀上保持竞争力。在 LLaVA-1.5 上,StepPrune 保留了 94.6% 的全前缀标准化性能,同时修剪了 88.9% 的视觉标记。当平均保留计数为 64 时,StepPrune 将预填充延迟从 59.95 毫秒减少到 40.05 毫秒,相当于预填充速度提高了 1.50 倍。