论文
捕获多模式 无需训练 词元修剪的词元趋势 大语言模型
Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models
摘要
虽然视觉标记修剪对于高效的多模态 大语言模型 (MLLM) 至关重要,但现有的 无需训练 方法存在关键限制:它们依赖静态、瞬时启发式方法来执行不可逆过滤。这种方法忽略了 MLLM 的层次性质,其中词元重要性通常动态变化,而不是跨层保持固定。因此,深层推理所必需的标记通常会被浅层估计过早地丢弃。为了解决这个问题,我们提出了趋势感知剪枝,这是一种新颖的框架,它将剪枝从本地快照决策提升为时间轨迹建模问题。我们的方法不依赖孤立的分数,而是捕捉注意力流的动量。这使得动态纠正机制能够选择性地重新激活“晚熟”词元,这些词元最初被低估,但表现出不断上升的语义重要性,从而防止关键视觉线索的丢失。大量的实验表明,我们的方法在不同的多模式任务中实现了卓越的效率与性能权衡。值得注意的是,它减少了超过 77.8% 的视觉标记,在最后一层仅保留约 23 个标记,同时保持有竞争力的性能,为高效多模态推理提供了强大且可逆的解决方案。