论文
CoViST:通过可组合状态进行视觉词元压缩
CoViST: Visual Token Compression via Composable States
摘要
视觉标记压缩通过用更少的标记表示图像来降低视觉语言模型的推理成本。然而,大多数现有方法将视觉标记压缩为简化的集合,留下每个标记所表示的视觉证据的数量及其隐式的原始空间上下文。因此,压缩表示不会显式编码每个表示携带多少视觉信息或其位于原始图像中的位置。即使在单次缩减之后,这种限制也会出现,并且当跨解码器层重复压缩时,这种限制会变得更加明显。为了解决这个问题,我们提出了 CoViST,一个无需训练的框架,它将压缩图像表示为可组合的视觉状态。具体来说,状态将代表性特征与原始位置、有效贡献权重和可重用的选择元数据相结合。 CoViST 通过覆盖引导的选择和基于保护的贡献合成来构建这种状态,并明确地将其贡献和位置信息纳入解码器注意力中。状态的每个组成部分在连续减少下保留其解释,使得相同的公式能够支持预填充之前的固定压缩和解码器内的渐进压缩。七个 LLaVA-1.5-7B 基准测试的实验结果表明,CoViST-Fixed 在 192、128 和 64 个 token 下分别保留了 99.9\%、99.5\% 和 98.1\% 的未压缩性能,CoViST-Pro 在相应的层平均值上保留了 99.8\%、99.9\% 和 99.1\%预算,在各自的预算设置下优于最先进的方法。代码将公开发布。