论文

当注意力崩溃时:从结构到语义的阶段感知视觉标记修剪

When Attention Collapses: Stage-Aware Visual Token Pruning from Structure to Semantics

模型推理推理加速

摘要

视觉语言模型 (VLM) 已展现出卓越的功能,但在推理过程中却面临着巨大的计算开销。虽然视觉标记修剪提供了一个有前途的解决方案,但现有方法主要依赖于初始注意力分数。这种单一度量范式存在一个严重缺陷:高注意力分数本质上会崩溃到语义相似的区域,从而严重减少特征多样性并丢弃重要的上下文细节。为了解决这个问题,我们引入了结构到语义(STS),这是一种新颖的两阶段视觉标记修剪框架,可以显式地解耦修剪过程。第一阶段采用基于排斥的采样机制来最大化空间和结构多样性。第二阶段利用指令感知交叉注意力来精确过滤掉与提示无关的标记。这种两阶段的协同构成了STS的核心,首先确保几何覆盖,然后根据语义相关性细化保留的标记。广泛的评估表明,STS 减轻了基于注意力的选择造成的冗余,提高了保留视觉标记的结构多样性和细粒度任务对齐。