论文

PixelPrune:通过预测编码减少像素级自适应视觉标记

PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding

模型推理推理加速

摘要

文档理解和 GUI 交互是视觉语言模型 (VLM) 的最高价值应用之一,但它们带来了异常沉重的计算负担:细粒度文本和小型 UI 元素需要高分辨率输入,从而产生数以万计的视觉标记。我们观察到这种成本在很大程度上是浪费的——在文档和 GUI 基准测试中,只有 22--71\% 的图像补丁是像素唯一的,其余的都是同一图像中另一个补丁的精确副本。我们提出 \textbf{PixelPrune},它通过基于预测编码的压缩来利用这种像素级冗余,在 Vision Transformer (ViT) 编码器之前修剪冗余补丁 \emph{。由于 PixelPrune 在任何神经计算之前在像素空间中运行,因此它可以加速 ViT 编码器和下游 LLM,覆盖完整的推理管道。该方法是 无需训练,不需要可学习的参数,并支持像素无损压缩 ($τ{=}0$) 以及受控有损压缩 ($τ{>}0$)。跨三种模型规模以及文档和 GUI 基准测试的实验表明,PixelPrune 保持了具有竞争力的任务准确性,同时提供高达 4.2$\times$ 的推理加速和 1.9$\times$ 的训练加速。代码可在 https://github.com/OPPO-Mente-Lab/PixelPrune 获取。