论文
谁为修剪过的人说话?作为覆盖优化的视觉词元修剪
Who Speaks for the Pruned? Visual Token Pruning as Coverage Optimization
摘要
视觉标记修剪降低了视觉语言模型(VLM)的推理成本,但大多数方法只询问保留哪些标记。这种保留词元视图可以保留冗余的高分词元,同时留下没有密切代表的丢弃证据。我们提出了 CoverPruner,一个 无需训练 剪枝器,它提出了补充的需求方问题:在删除词元后,哪个幸存的原始词元代表目标 VLM? CoverPruner 将修剪制定为代表性覆盖最大化 (RCM),覆盖具有查询加权需求的完整投影视觉标记集。它通过投影仪空间覆盖和轻量级第一层注意力探针实例化 RCM。在多种 VLM 架构和压缩率中,CoverPruner 在所有比较方法中实现了最佳的平均准确度,最大的增益通常出现在激进的压缩下。