论文
DynaTok:视频的时间自适应和位置偏差感知词元压缩-LLM
DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs
摘要
Video 大语言模型 (Video-LLM) 的最新进展极大地扩展了多模态推理能力。然而,从长视频序列中提取的大量视觉标记会产生高昂的计算成本,限制了它们在现实场景中的部署。现有的 无需训练 词元压缩方法根据注意力大小选择词元作为语义重要性的代理,但往往忽略位置偏差并仅依赖于短期时间局部性,导致冗余的时空覆盖和低效的词元使用。我们提出了 DynaTok,一个 无需训练,时间自适应和偏差感知的词元压缩框架,它在时间和空间维度上分配 词元预算。通过轻量级指数移动平均 (EMA) 内存,时间预算分配 (TBA) 模块动态地将更少的词元分配给冗余帧,将更多的词元分配给新颖的帧,从而捕获长期时间变化。空间预算分配(SBA)模块通过使用基于激活的注意力图选择空间多样化且语义上重要的特征来补充这一点,同时利用空间记忆来减少先前选择区域的冗余并减轻位置偏差。 DynaTok 与现有 Video-LLM(例如 LLaVA-OneVision 和 LLaVA-Video)无缝集成,无需重新训练,并在积极压缩下有效保留语义覆盖范围。对四个代表性 VideoQA 基准(MVBench、LongVideoBench、MLVU 和 VideoMME)进行的实验表明,即使词元减少了 90%,DynaTok 仍保留了 95% 以上的基线准确度,超越了最近的 无需训练 方法。这些结果表明,DynaTok 为高效、稳健的视频推理提供了原则基础,为未来 Video-LLM 的实时流视频理解铺平了道路。