论文
DiffPrune:视觉语言模型中用于标记修剪的可微分信息节流
DiffPrune: differentiable information throttling for token pruning in vision-language models
摘要
视觉标记修剪通过删除冗余视觉标记来降低视觉语言模型 (VLM) 的计算成本。关键是要学习一个衡量词元是否有用的分数。现有方法通常依赖 Gumbel-Softmax 在训练期间近似离散选择。这样的选择器使分数取决于宽松剪枝算子的行为,而不是直接取决于信息丢失的后果。在本文中,我们提出了 DiffPrune,它赋予 token 分数直接的含义。在训练过程中,DiffPrune 保留所有标记,并根据其得分削弱每个标记的信息。如果削弱一个词元会损害任务,那么记分员就会被迫保护它;如果没有,该词元可能会获得较低的分数。由于损失是通过这种实际的信息节流路径来区分的,因此评分器避免了宽松词元选择的不稳定代理路径。 DiffPrune 通过信息节流器实现了这一想法,它将方差保留噪声注入视觉标记中,其中高分标记保持接近其原始表示,而低分标记携带较少的原始信息。在推理时,节流器被移除,并使用学习到的分数应用硬顶 K 剪枝。在十个 VLM 基准测试中,DiffPrune 保留了 96.5% 的全模型精度,同时将 LLM 预填充速度加快了 2.85 倍,推理开销仅为 0.69 毫秒。代码将公开。