论文

避免视觉失语症:视觉语言模型的对比自适应语义标记修剪

Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models

模型推理推理加速

摘要

低注意力的视觉标记在视觉语言推理中真的是多余的吗?现有的剪枝方法通常是这样假设的,通过浅层文本到图像的注意力对视觉标记进行排序,并丢弃低分补丁以加速 LVLM 推理。我们表明,这种标量标准对于组合推理来说是不可靠的:在早期层中被忽略的标记后来可能成为解决次要对象、空间关系和上下文线索的关键。因此,过早的修剪可能会导致视觉失语症,这是一种模型失去视觉基础并依赖于语言先验的失败模式。我们介绍 COAST(COntrastive 自适应语义词元修剪),这是一个 无需训练 修剪框架,它将压缩转换为自适应语义路由。 COAST 使用原生跨模式注意力来识别特定于查询的锚点,并通过注意力熵估计上下文分散,然后调整语义证据和空间上下文之间的保留权衡。它进一步使用对比路由分数来保留锚对齐的证据和互补的空间上下文。在七个基准测试中,COAST 将视觉标记减少了 77.8%,实现了 2.15 倍的延迟加速,同时保留了 98.64% 的原始平均性能。除了单个主干或压缩设置之外,COAST 在 词元预算 上始终优于强大的剪枝基线,并在多个 LVLM 系列中泛化,这表明自适应语义路由是一次性标量剪枝的强大替代方案