论文
CRISP:LLM 之前的文本驱动视觉标记修剪,用于高效 LVLM 推理
CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference
摘要
大型视觉语言模型 (LVLM) 通常需要处理数百到数千个视觉标记,从而导致大量的推理开销。现有的视觉标记修剪方法要么使用与文本无关的启发式在 LLM 之前运行,要么在 LLM 内部进行修剪,但以效率和嘈杂的跨模式注意力为代价。为了解决这些限制,我们提出了 CRISP,这是一个 LLM 之前的文本驱动的视觉标记修剪框架,可以保留指令相关的证据和基本的场景上下文。 CRISP 在两个阶段的管道中工作:第 1 阶段首先识别文本对齐的视觉标记,第 2 阶段通过语义多样性增强上下文完整性。 LLaVA-1.5 和 LLaVA-NeXT 上的大量实验表明,CRISP 在激进的剪枝率下实现了卓越的性能保留,保持高达 99.5% 的准确率,同时将推理成本和延迟降低了 2 倍以上。 CRISP 是高效 LVLM 推理的实用解决方案,尤其是在资源受限的场景中。