论文

消息,而不是词元:用于忠实 VLM 压缩的基础核心集

Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression

模型推理推理加速

摘要

现代视觉语言模型 (VLM) 将高分辨率图像转换为长的视觉标记序列。每个词元都会遍历语言解码器并保留在其即时 KV 缓存中,从而增加推理成本并激发积极的视觉压缩。现有的基于分数的方法为每个标记分配一个独立的重要性分数并保留 Top-K。然而,文本查询消耗来自视觉群体的集体、签名的注意消息,而不是孤立的补丁。因此,同等大小的 Top-K 集可以重复覆盖一个显着区域,省略稀疏但互补的证据,并丢弃被移除群体携带的信息。因此,我们将忠实的视觉压缩制定为为解码器消息构建紧凑的核心集,并引入我们的 无需训练 证据对齐的消息核心集修剪(GMC),它联合分配基于查询、外观和坐标感知证据的支持,然后在物理压缩和本地注意力恢复之前将丢弃的状态传输到原始多模态位置的选定代表中。这将忠实压缩分解为两个耦合组件,包括选择覆盖所需消息模式的载体并在这些载体上实现签名的总体消息。我们进一步推导了将它们的错误与签名消息失真、视觉创新和候选边缘稳定性联系起来的界限。跨多个 VLM 系列和不同基准的实验显示出强大的性能,GMC-H2 在 Qwen2.5-VL-7B 上使用减少 80.2% 的视觉标记保留了 97.78% 的完全相对平均能力,而 GMC-L16 达到了 100.36%。受控干预措施证实集体支持和人口实现共同推动了这些成果。