论文
PACE:用于快速 VLM 推理的统一压缩和提取范式
PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference
摘要
视觉语言模型(VLM)展示了卓越的视觉推理能力,但其推理成本随着视觉标记的激增而迅速上升。现有的视觉标记修剪方法表现出两个基本局限性。首先,大多数方法专门运行视觉后编码器,导致视觉编码阶段的大量延迟未得到优化。其次,在严格的 词元预算 下,这些方法通常无法共同保留整体视觉上下文和细粒度细节,从而导致性能下降。为了解决这些瓶颈,我们提出了 PACE(像素自适应压缩和提取),这是一种 无需训练 推理框架,可通过统一的压缩和提取范式加速视觉编码器和 大语言模型 (LLM)。在压缩阶段,自适应像素压缩器 (APC) 在编码之前评估视觉信息密度,自适应地对冗余输入进行下采样,减少编码器计算,同时保留全局上下文和基本视觉线索。在提取阶段,动态双注意力提取器 (DDAE) 通过融合来自编码器的内部视觉信号和来自 LLM 的语义信号选择性地保留视觉标记,从而保护任务关键细节。通过将 PACE 集成到 Qwen2.5-VL-7B 中,该模型保留了 93.8% 的原始性能,同时仅利用 10% 的视觉标记,首次标记时间 (TTFT) 加速了 3.1 倍。我们的代码可在 https://github.com/jjL357/PACE 获取。