论文

从继承到饱和:解开视觉冗余的演变,实现架构感知的 MLLM 推理加速

From Inheritance to Saturation: Disentangling the Evolution of Visual Redundancy for Architecture-Aware MLLM Inference Acceleration

模型推理推理加速

摘要

由于视觉标记的爆炸式增长,高分辨率多模态 大语言模型 (MLLM) 在推理过程中面临着高昂的计算成本。现有的加速策略,例如词元修剪或层稀疏性,受到严重的“骨干依赖性”的影响,在 Vicuna 或 Mistral 架构(例如 LLaVA)上表现良好,但在转移到 Qwen 等架构时会导致性能显着下降。为了解决这个问题,我们利用截断矩阵熵来揭示通用的三阶段推理生命周期,将视觉冗余解耦为通用的内在视觉冗余(IVR)和依赖于架构的二次饱和冗余(SSR)。在这一见解的指导下,我们提出了HalfV,一个框架,首先通过统一的修剪策略来缓解IVR,然后根据其具体表现自适应地处理SSR。实验表明,HalfV 在不同的主干网中实现了卓越的效率与性能权衡。值得注意的是,在 Qwen25-VL 上,它以 4.1$\times$ FLOP 加速比保留了 96.8% 的性能,显着优于最先进的基线。我们的代码可在 https://github.com/civilizwa/HalfV 获取。