论文
高效多模式的逐步词元选择 大语言模型
Stepwise Token Selection for Efficient Multimodal Large Language Models
摘要
在多模态 大语言模型 (MLLM) 中,推理成本主要由视觉标记前缀而不是语言主干主导,这使得标记减少成为提高效率的关键因素。现有方法通常为视觉标记分配独立的重要性分数,并保留固定数量的顶级标记,隐含地假设标记独立性和输入之间的统一压缩比。在这项工作中,我们将视觉标记修剪重新表述为一个顺序决策过程。具体来说,我们引入了一种指针式选择机制,该机制迭代地选择信息标记,根据先前选择的标记调整每个决策,并通过学习的终止操作动态确定何时停止。这使得能够联合优化所选子集及其大小。为了在标准语言建模目标下实现端到端训练,我们设计了基于方差保留噪声插值方案的可微松弛,允许梯度通过离散选择过程传播。 LLaVA-v1.5-7B 和 Qwen2.5-VL-7B 上的大量实验表明,我们的方法在不同压缩级别上始终优于固定比率基线。在去除 88.9% 视觉标记的积极修剪下,我们的方法保留了 94.6% 的原始准确率,同时预填充延迟实现了 1.88 倍的加速。