论文

TTF:用于高效视频语言模型的时间词元融合

TTF: Temporal Token Fusion for Efficient Video-Language Model

模型推理推理加速

摘要

视频语言模型 (VLM) 面临着快速的推理成本,因为视觉标记计数随着视频长度的变化而变化。例如,在 Qwen3-VL 中,分辨率为 448{\times}448$ 的 32 帧已经产生了 >8,000 个视觉标记,使得 LLM 预填充了主要的吞吐量瓶颈。现有的方法通常依赖于全局相似性或注意力引导压缩,从而导致其收益被抵消。我们提出 \textbf{Temporal Token Fusion (TTF)},这是一种 无需训练、即插即用的预 LLM 词元压缩框架,利用视频中的结构化时间冗余。 TTF 自动选择一个锚帧,然后对于每个后续帧,执行局部窗口相似性搜索(例如,$3\times 3$),融合超过阈值的标记。压缩序列通过坐标重新对齐保持预填充和解码之间的位置一致性,从而实现与现有 VLM 管道的无缝集成。在阈值 t=0.70 的 Qwen3-VL-8B 上,TTF 删除了大约 67% 的视觉标记,同时保留了 99.5% 的基线精度,并且仅引入 ${\approx}0.16$\,GFLOPs 的匹配开销。总体而言,TTF 为视频理解提供了实用、高效的解决方案。代码可在 \href{https://github.com/Cominder/ttf}{https://github.com/Cominder/ttf} 获取