论文
ViCoStream:流式视频LLM 通过阶段协调推理可以运行超过 100 FPS
ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference
摘要
流式 VideoLLM 必须持续处理传入视频,同时保持低查询延迟,这使得视频摄取吞吐量和查询时间响应能力对于实时部署至关重要。现有方法主要集中于加速各个模块,例如视觉编码、词元修剪或 KV 缓存压缩,但对最终系统是否能够维持实时流性能的了解有限。我们将流式 VideoLLM 推理制定为涵盖视觉预处理、视觉编码、词元丢弃和 LLM 预填充/解码的协调管道。在此基础上,我们提出了 ViCoStream(视频协调流),这是一种分阶段协调流框架,它结合了分块执行、CUDA 流重叠、视觉词元控制、有限视觉注意力和查询端检索,以限制每个块的计算和内存成本。我们进一步提供了对瓶颈迁移的系统研究,揭示了块大小、词元保留、注意力局部性和检索范围如何影响吞吐量与准确性的权衡。在多个流媒体基准测试中使用 Qwen2.5-VL-3B/7B-Instruct 进行的实验表明,ViCoStream 在单个 A100 GPU 上实现了 134 FPS 视频吞吐量和低于 50 毫秒的 TTFT,同时保持接近全历史基线的精度。