论文
超越一刀切:MLLM 中视觉词元修剪的样本自适应策略路由
Beyond One-Size-Fits-All: Sample-Adaptive Strategy Routing for Vision Token Pruning in MLLMs
摘要
多模态 大语言模型 (MLLM) 处理每个图像数百或数千个视觉标记,从而产生过高的推理成本。虽然现有的视觉词元修剪方法减轻了这种开销,但它们隐含地假设单个固定修剪策略可以在所有输入上统一应用。我们的分析进一步表明,按平均基准准确度对剪枝方法进行排名掩盖了实质性的样本互补性:尽管平均最佳策略总体上表现出色,但替代策略在很大一部分个体样本上表现出优越性。为了利用这种多样性,我们提出了 VIP-Router,这是一种轻量级视觉修剪路由器,它自适应地选择预测最适合指定修剪级别的每个输入的修剪策略。以低成本的视觉和文本特征为条件,VIP-Router 可以识别最合适的候选策略,同时在预测修剪不利时保留全词元推理作为选项。在一套精心设计的剪枝敏感视觉感知基准 VTC-Bench Group A 上进行评估,VIP-Router 在所有缩减比率上始终优于最佳固定策略基线,平均准确度相对提高 26.9%,在考虑已实现的词元成本后,平均效用相对增加 22.0%。至关重要的是,VIP-Router 以即插即用的方式运行,无需修改底层剪枝算法或模型权重,引入的可训练参数仅相当于主干网的 0.017%。此外,VIP-Router 在各种 MLLM 主干上被证明是有效的,并且在未见过的基准上产生一致的收益,凸显了样本自适应路由在视觉词元修剪方面的潜力。