论文

并非所有冗余词元都是相似的:通过词元角色分析视觉词元修剪

Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles

模型评测模型行为与机制分析

摘要

视觉语言模型 (VLM) 将图像作为一系列视觉标记进行处理,这在推理过程中造成了巨大的计算瓶颈。最近的视觉标记修剪方法通过删除看似多余的标记来解决这个问题,但仍不清楚这些修剪决策与视觉标记的功能角色有何关系。在这项工作中,我们通过 EmbedLens 识别的词元角色的角度来分析视觉词元修剪。我们首先表明,代表性的修剪方法表现出明显的词元角色偏差,但这些偏差并不与下游性能直接相关。为了更好地理解这种行为,我们改进了词元角色分配过程并评估了角色保护的修剪变体。我们的结果表明,保留非活动词元有时可以维持或提高性能,这表明直接语义对齐较弱的词元仍可能影响剪枝下的模型行为。我们的代码可在 https://github.com/jaykim9870/Not_All_Redundant_Tokens_Are_Alike 上公开获取。