论文
用于高分辨率 MLLM 中高效视觉词元修剪的结构化冗余建模
Structured Redundancy Modeling for Efficient Visual Token Pruning in High-Resolution MLLMs
摘要
最近的高分辨率多模态 大语言模型 (MLLM) 每个输入生成数千个视觉词元,导致视觉词元爆炸,从而引入严重的延迟瓶颈。虽然词元修剪缓解了这个问题,但最先进的子集优化方法通常依赖于迭代子集构造来共同捕获视觉多样性和指令相关性。随着视觉标记计数的扩展,这种顺序依赖性引入了显着的选择开销,严重限制了理论 FLOP 减少到实际挂钟加速的转化。为了解决这个限制,我们提出了单前向剪枝器(SFPruner),这是一种视觉标记剪枝的结构重构,它将冗余控制直接嵌入到评分空间中,绕过了迭代组合优化的需要。我们的非迭代框架通过两种互补机制在一次前向传递中实现了冗余感知重要性选择。首先,为了减少协方差级别的冗余,我们引入了语义引导的岭杠杆方案。通过整合指令相关性和视觉显着性,该机制抑制了主导协方差方向并减轻了表示偏差。其次,基于排名的定向屏蔽通过不对称相似性竞争解决残留重叠,其中较高得分的标记通过并行张量操作显式抑制冗余的较低得分的替代方案。广泛的评估表明,我们的方法保持了稳定的选择成本,将 Qwen2.5-VL 中 512 个词元的词元选择过程减少了多达 110 毫秒,从 112.4 毫秒减少到仅 2.5 毫秒。这种结构效率成功地将理论上的词元减少转化为有形的推理加速,同时在积极的压缩下保持与最先进技术相比的高度竞争性能。