论文

中心凹压缩:选择性保留高分辨率视觉区域

Foveated Compression: Selective High-Resolution Preservation for Token-Efficient VLMs

模型优化稀疏化

摘要

Visual token 是视觉语言模型中推理成本的主要来源,但简单的图像下采样仍然是令人惊讶的强大压缩基线。这就提出了一个补充问题:在固定的 token 预算下,应该在哪里保留视觉保真度?我们引入了 Foveated Compression,它对全分辨率图像进行一次编码,并用原始分辨率和压缩分辨率视觉 token 的混合来表示它。行为自蒸馏的 Foveated Merger 压缩本地视觉 token,同时保持与本地对应项的兼容性,而轻量级 Foveated Selector 使用详尽的预算匹配干预监督,选择九个空间单元之一以保留原始分辨率。在 11.11% 视觉 token 下,均匀中心点压缩与 iso-token 下采样没有显着的配对差异。学习选择器的性能为 20.99%,显着优于随机和固定分配,但仍低于强大的整体图像大小调整,这表明局部保真度并不是普遍优选的。预算匹配的区域选择预言机的宏观准确度达到 82.73,而学习选择器的宏观准确度为 69.61,在相同的空间行动空间中显示出巨大的空间。匹配探测进一步表明,在语言模型计算之后,预测压缩何时破坏答案的信号比轻量级 预填充-free 选择器更容易访问。这些结果暴露了区域选择和压缩区域保真度方面的互补瓶颈。

中心凹压缩:选择性保留高分辨率视觉区域:论文原图
图 2:中心凹压缩概述。图像由冻结视觉 骨干模型 编码一次,注视点合并产生全局压缩表示,注视点选择器通过就地替换用原生视觉 token 恢复一个选定的空间单元。