论文

WaveZip:小波驱动的时空解耦用于视频词元凝聚

WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation

模型推理推理加速

摘要

由于视觉标记的二次计算成本,现有的大型视觉语言模型(LVLM)难以理解长格式视频。虽然最近的有效方法尝试通过硬剪枝或统一合并来压缩标记,但它们严格在空间特征域中运行,其中鲁棒的结构上下文和判别性语义细节本质上是纠缠在一起的。在这项工作中,我们提出了 WaveZip,一种用于高效视频推理的联合信号频域框架。由于时间冗余存在于低通近似尺度而空间显着性与高频分量密切相关,WaveZip 利用离散小波变换 (DWT) 来解开这些信号。在时间上,它采用 1D DWT 来分析查询帧相关性,所得到的高频系数进一步通过帧间差异进行门控,两个信号共同驱动精确帧级 词元预算 的动态分配。在空间上,2D DWT 将特征分解为低频近似和高频细节分量,其中高频系数在查询显着区域内进行调制以调节空间重建。重要的是,WaveZip 不需要特定于任务的训练,并且可以无缝集成到现成的 LVLM 中以提高推理效率。对长视频理解基准的大量实验表明,WaveZip 在极端 10 倍压缩比下保留了 99.6% 的全部性能,始终优于最先进的方法。