论文

多模态中光谱进化引导的词元修剪 大语言模型

Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models

模型推理推理加速

摘要

减少视觉词元冗余对于加速多模态 大语言模型 (MLLM) 且不降低跨模态推理性能至关重要。现有的词元修剪方法通常依赖于单层信号,例如注意力分数或词元相似性,它们忽略了视觉表示的跨层转换,并且可能在多模式词元序列中表现出位置偏差。为了解决这个限制,我们提出了一种基于跨层谱演化(CLSE)的 无需训练 词元修剪框架。 CLSE 不是从单层特征量值来衡量词元重要性,而是量化频域中 Transformer 层上词元表示的演变方式。这种演变反映了从高频结构细节到低频语义抽象的转变。我们观察到,跨层频谱重新分布更强的标记更有可能在语义上活跃,因此应该保留。通过对跨层词元动态进行建模,CLSE 提供了一个稳定的重要性标准,可以减轻位置偏差。对图像和视频基准的大量实验表明,CLSE 在积极减少词元的情况下实现了效率和准确性之间的卓越权衡。在多个 MLLM 中,CLSE 减少了 FLOP、KV 缓存内存和延迟,同时保持竞争力或改进的性能。