论文

Fre-Res:用于高效视频 MLLM 的频率残留视频词元压缩

Fre-Res: Frequency-Residual Video Token Compression for Efficient Video MLLMs

上下文与知识上下文工程

摘要

视频 MLLM 面临着空间保真度和时间覆盖之间的持续紧张关系:保留细粒度的视觉细节需要许多空间标记,而捕获短暂事件则需要密集的时间采样。我们提出了 \textbf{Fre-Res},一种预算自适应的双轨视频词元压缩框架,它将这两种形式的证据分开。 Fre-Res 保留了稀疏的高保真空间锚点,并通过紧凑的残余频率标记表示密集的时间演化。具体来说,它将时间 1D-DCT 应用于视觉潜在空间中的帧间残差轨迹,我们在其中观察到强烈的低频集中。为了使频域动态与本地视觉嵌入保持一致,Fre-Res 引入了空间引导吸收器,它将时间残差信息注入到空间对应的锚标记中。在细粒度的短视频和长视频推理基准测试中,Fre-Res 实现了良好的准确性-效率权衡,匹配或接近全词元性能,同时大幅缩短视觉词元长度。广泛的消融进一步表明,时间频率残差保留了因果转换线索,而空间锚点对于细粒度对象和布局推理仍然至关重要。