论文
超越代理梯度:视觉语言模型的完全可微分标记修剪
Beyond Surrogate Gradients: Fully Differentiable Token Pruning for Vision-Language Models
摘要
视觉标记修剪通过删除冗余视觉标记来降低视觉语言模型 (VLM) 的计算成本。现有方法通常依赖 Gumbel-Softmax 在训练期间近似离散选择。然而,优化是由替代梯度驱动的,而不是真正的选择过程,导致词元重要性的学习不可靠。在本文中,我们提出了 DiffPrune,它将剪枝重新表述为对 token 信息的连续控制,而不是离散选择学习。具体来说,我们引入了一个信息节流器,它使用以重要性分数为条件的方差保留噪声来调节每个标记,其中分数越高,训练期间的信息抑制就越少。这种设计直接对词元表示进行操作,自然地为学习词元重要性提供了完全可微的优化路径。在推理时,通过对学习分数进行硬阈值处理来删除标记。在十个 VLM 基准测试中,DiffPrune 保留了 96.5% 的全模型精度,同时将 LLM 预填充速度加快了 2.85 倍,推理开销仅为 0.69 毫秒。