论文

从显着性到可辨别性:VLM 重新排名器的排名保留视觉标记修剪

From Saliency to Discriminability: Rank-Preserving Visual Token Pruning for VLM Rerankers

模型推理推理加速

摘要

用作列表重新排序器的大型视觉语言模型必须联合处理每个查询中数十个候选者的视觉标记,这使得标记修剪对于实际部署至关重要。现有的修剪方法通过注意显着性保留标记,但我们表明显着性与排名贡献系统性地不一致:视觉上突出的标记通常捕获候选者之间共享的顺序中性模式。这种不匹配是层相关的:只有在注意力集中的情况下,显着性才变得具有信息性,并且标准化注意力熵可以诊断可靠性转移(Pearson r=0.87)。我们提出 RaDiCal(排名判别校准),这是一个 无需训练 框架,它使用归一化注意力熵来决定显着性何时可以被信任,将其与无注意力排名判别先验融合,并从相同的信任环境中选择修剪层。在三个检索基准和多个 VLM 架构中,RaDiCal 在 Flickr30K 上与 Dense MRR@10 相匹配,并在 MSCOCO 上以 20% 词元预算 超越它,在 FashionIQ 上的所有修剪方法中排名第一,并在 Flickr30K 和 MSCOCO 上以 10% 的保留率保持在 1.2 pp 以内。它将 FLOPs 减少了 39--45%,并在两个 VLM 架构中提供了 1.28--1.45$\times$ 测量加速,而无需针对特定数据集进行重新调整。