论文

EarlyTom:早期词元压缩完成快速视频理解

EarlyTom: Early Token Compression Completes Fast Video Understanding

模型推理推理加速

摘要

视频大语言模型(Video-LLM)在视频理解任务中表现出了强大的能力。然而,它们的实际部署仍然受到处理大量视觉标记所带来的低效率的阻碍。尽管最近的方法实现了极低的词元保留率,同时保持了与全词元基线相当的精度,但大多数方法仅在预填充的后期阶段执行压缩,从而使视觉编码器的效率未得到优化。在本文中,我们首先表明视觉编码对首次标记时间(TTFT)贡献很大。因此,不是仅在视觉编码器之后压缩视觉标记,而是在编码器内部执行压缩仍然留有很大的探索空间。基于这一见解,我们提出了 EarlyTom,这是一种 无需训练 词元压缩框架,可在视觉编码器内执行早期视觉词元压缩,从而显着更好地减少 TTFT 并提高吞吐量。此外,我们引入了一种解耦的空间词元选择策略,可以提高整体压缩效率。 EarlyTom 在 LLaVA-OneVision-7B 模型的单个 NVIDIA A100 GPU 上将 TTFT 降低高达 2.65 倍,将 FLOP 降低高达 61%,同时保持与全词元基线相当的精度。这些改进大大增强了在实际生产场景中部署Video-LLM的实用性。