论文
视觉词元修剪失败的原因和时间? MLLM解码中相关视觉信息转移的研究
Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding
摘要
最近,人们研究了视觉标记修剪,以处理多模式 大语言模型 中的大量视觉标记。然而,我们观察到,虽然现有的修剪方法在简单的视觉理解上表现可靠,但它们很难有效地推广到复杂的视觉推理任务,这是以前的研究中尚未探索的一个关键差距。通过系统分析,我们将解码过程中的相关视觉信息偏移(RVIS)确定为主要的故障驱动因素。为了解决这个问题,我们提出了解码阶段移位感知词元修剪(DSTP),这是一个 无需训练 附加框架,使现有的修剪方法能够在解码阶段将视觉词元与移位推理要求保持一致。大量实验表明,DSTP 显着减轻了复杂推理任务中剪枝方法的性能下降,同时即使在视觉理解基准测试中也能持续获得性能提升。此外,DSTP 展示了跨各种最先进架构的有效性,突出了其通用性和效率,并且计算开销最小。