论文

CoFiE:从粗到细的证据选择以实现高效的流媒体视频理解

CoFiE: Coarse-to-Fine Evidence Selection for Efficient Streaming Video Understanding

模型推理推理加速

摘要

流视频理解需要视觉语言模型 (VLLM) 来处理不断增长的视频流并在严格的延迟限制下回答用户问题。现有方法通过词元修剪和内存库方案提高效率,但主要是在视觉编码后减少视觉词元。因此,仅下游词元修剪并不能显着减少端到端延迟,因为已经产生了昂贵的帧编码成本。我们提出了 CoFiE,一种从粗到细的证据选择框架,它将证据选择解耦为视觉编码器之前的粗略、与查询无关的过滤阶段和 LLM 预填充期间的精细、特定于查询的细化阶段。 CoFiE 引入新颖性引导帧过滤来保留视觉上独特的候选帧,并引入特定于查询的证据细化来选择与用户查询最相关的帧。这种设计在帧编码之前消除了大量冗余,同时在语义信息可用时保留特定于查询的细化。实验表明,CoFiE 在多个视频理解基准上建立了一种新的最先进的准确率与效率权衡,在 StreamingBench 上达到 78.86% 的准确率,在 OvO-Bench 上达到 68.72% 的准确率,比之前的方法提高了 3.15%。即使具有高达 80% 的证据帧过滤,CoFiE 的性能也优于强大的开源多模态模型,同时将端到端推理延迟提高了高达 2.54 倍。