论文

流媒体视频词元压缩的集合思考

Think in Sets for Streaming Video Token Compression

模型推理推理加速

摘要

流式 VideoLLM 因果性地处理帧,而视觉标记不断增长,这使得压缩对于控制预填充延迟和内存至关重要。现有的 无需训练 方法独立对词元进行排名,忽略保留词元之间的边际增益相互作用。我们认为,流视频词元压缩应该被表述为集合选择,其中每个候选者都根据其在已保留的词元之外添加的内容来评估。与现有的为离线任务设计的集合方法不同,流式处理会做出因果的、逐帧的修剪决策,因此对跨帧交互进行建模需要明确的历史参考。这造成了参考集的困境:参考必须充分代表先前传达的内容,同时保持实时推理的界限。我们介绍 NovaCov,据我们所知,这是第一个 无需训练,即插即用的设置明智的词元压缩器,专为流视频而设计。 NovaCov 维护一个容量有限、新近加权的历史参考库,并优化双分支子模块覆盖目标,该目标保留代表性的当前框架内容,同时优先考虑历史未充分覆盖的信息。两个分支都是设施位置函数,因此贪婪选择保留了经典的 (1-1/e) 近似保证。在流媒体和离线基准测试中,NovaCov 优于现有的 无需训练 压缩方法,保留了 99.6% 的 ReKV 准确性,同时将 LLM 预填充延迟减少了 46%。