论文

ETC:通过 VLM 中的任务感知视觉信息 蒸馏 进行极端词元压缩

ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs

模型推理推理加速

摘要

在视觉语言模型(VLM)中,高分辨率图像会产生大量视觉标记,导致推理过程中计算成本和 KV 缓存开销较高。为了解决这个问题,我们提出了一种极端词元压缩(ETC)框架,该框架根据变分信息 蒸馏 的原理,在减少输入词元数量时最大限度地减少任务损失。具体来说,从信息论的角度来看,我们表明,最小化任务损失需要紧凑的表示来保留任务相关视觉信息的指令感知足够的统计数据以进行预测。在实践中,ETC 利用文本到图像的交叉注意力来加权原始视觉特征,以近似潜在的指令感知预测统计。此外,ETC 引入了变分信息 蒸馏,使紧凑表示能够保留恢复此预测统计的基本信息。 LLaVA-1.5-7B 和 Qwen3-VL-2B 上的实验表明,即使在单词元压缩下,ETC 仍然有效,大大减少了 KV 缓存开销,同时保持了强大的任务性能。