论文

Visual Token 编解码器:释放 ViT 特征编码的空间冗余

Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding

模型优化模型压缩

摘要

大型视觉基础模型的分布式部署通常会划分 ViT 主干并在计算节点之间交换中间词元特征,这使得在带宽和计算限制下高效的特征压缩至关重要。现有的 ViT 特征编解码器通常将异构全局和补丁标记扁平化为 L x C 伪图像,导致熵模型主要捕获序列轴依赖性,同时忽略本机二维补丁网格结构。在本文中,我们表明 ViT 补丁标记在原始网格上保留了很强的局部空间相关性。为了利用这种结构先验,我们提出了视觉词元编解码器(VTC),这是一种双路径学习编解码器,它将全局词元和补丁词元分离到专用编码路径中。全局词元使用轻量级分解先验进行压缩,而补丁词元使用空间通道上下文熵模型在补丁词元网格上进行编码。为了支持中间层压缩和实际速率适配,VTC 在单个编解码器中的后续 ViT 块和可变速率模块之后进一步合并了特征匹配监督。 DINOv2 和 SAM3 上的实验表明,VTC 在分类、分割和检测任务上始终优于代表性 ViT 特征编码基线。在 90% 的未压缩功能性能下,VTC 将这些任务的比特率降低了 15.7x-37.4x。我们进一步为实际的面向传输和存储的部署场景提供中间层速率效用分析。