论文
视觉语言模型中保守词元凝聚的光谱热流
Spectral Heat Flow for Conservative Token Condensation in Vision-Language Models
摘要
视觉语言模型 (VLM) 在推理时成本高昂,因为它们必须处理长序列的视觉标记。现有的词元修剪方法通常会在高压缩下因盲目丢弃信息、破坏空间结构或破坏多样性而退化。我们提出了 SpecFlow,一个 无需训练 框架,它将范式从破坏性修剪转变为保守压缩,严格执行空间覆盖和统计守恒以确保稳定性。将视觉标记视为 $k$NN 图中的节点,SpecFlow (i) 通过光谱热流计算稳定的重要性字段以保持结构一致性,(ii) 通过自适应空间分区分配预算以保证覆盖范围,以及 (iii) 将丢弃的信息聚合到核心集接收器中以保持统计守恒。该方法即插即用,不需要微调,并且兼容FlashAttention。实验证实,我们的 SpecFlow 在任务、VLM 架构和剪枝率方面优于 SOTA 方法。值得注意的是,尽管修剪了 88.9% 的视觉标记,但采用 SpecFlow 的 LLaVA-1.5 仍保留了 95.6% 的原始性能,提供了卓越的效率与准确性平衡。代码可在 https://github.com/Lzy-dot/SpecFlow 获取