论文
视频多模态的视觉词元编码 大语言模型
Visual Token Coding for Video Multimodal Large Language Models
摘要
在本文中,我们提出了一种新的视频多模态 大语言模型 (MLLM) 词元压缩范例,称为视觉词元编码 (VTC)。受经典视频编码原理(例如 HEVC)的启发,VTC 通过预测视频的 I/P 帧并测量其逐帧残差来估计词元冗余来执行结构化压缩。基于这个基线框架,我们还通过一组新颖的动态设计增强了VTC,例如动态分辨率输入(DyRSO)、动态词元分配(DyTA)和空间覆盖Top-K(SC-TopK),并将这种新方法称为$VTC_{Dy}$。为了验证 VTC,我们将其应用于三个 MLLM,并在多个视频理解基准上进行实验。实验结果表明,对于 Qwen3-VL,VTC$_{\mathrm{Dy}}$ 在 词元预算 为 50% 的情况下实现了 100.1% 的平均性能保留,而当 词元预算 减少到 25% 时仍然保留了 97.8% 的平均性能。此外,作为一种即插即用的设计,VTC 不需要对 MLLM 进行额外的调整来进行词元编码。我们的代码可在 https://github.com/Msr233/VTC 获取。