论文
QCPruner:用于视觉标记修剪的查询条件总体覆盖范围
QCPruner: Query-Conditioned Population Coverage for Visual Token Pruning
摘要
多模态大语言模型(MLLM)中的高视觉标记负载激发了免训练剪枝以减少后面层的计算,但在固定预算下,剪枝必须保留与查询相关的证据,同时避免冗余。现有方法对标记进行排名、使所选子集多样化或优化覆盖范围,而不使用共享的每个视觉查询实用程序来对视觉目标和候选代表进行加权。我们引入了 QCPruner,它通过双边效用权重使两个角色都具有查询条件。使用关键字匹配的查询锚点,QCPruner 将两个跨模式线索融合为实用程序,并将其应用于基于视觉亲和力的覆盖范围内的视觉目标和候选代表。由此产生的非负设施位置目标是单调和子模的,保留标准 (1-1/e) 贪婪保证,并且不需要模型训练或参数更新。在 LLaVA-1.5、LLaVA-NeXT、LLaVA-Video 和 Qwen2.5-VL 中,QCPruner 在每个报告的词元预算下,在评估的完整系统修剪方法中实现了最高的平均相对性能。在 LLaVA-1.5-7B 上的 576 个词元中,有 32 个词元保留了 96.1% 的未修剪性能,而最强评估基线的保留率为 93.9%。在 Qwen2.5-VL-7B 上的 1296 个词元中,有 256 个词元的对应值为 96.7% 和 92.5%。