论文

ShallowStream:浅索引然后深回答以实现流视频理解

ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding

模型推理推理加速

摘要

流媒体视频理解是现实世界应用的一项关键功能,包括实体智能、自动驾驶、工业监控、监视和预警以及可穿戴助手。然而,使用多模态 大语言模型 (MLLM) 处理连续视频流的计算成本很高。现有的工作已经探索通过视觉词元修剪、词元合并、量化、按需帧检索和上下文卸载来减少流开销。然而,大多数现有方法忽略了模型深度的维度。对传入帧重复执行全深度 MLLM 预填充的成本极高,会产生大量计算开销,并导致 KV 缓存以与预填充深度成正比的速率增长。为了应对这些挑战,我们提出了 ShallowStream,这是一种新颖的框架,它利用 MLLM 的浅层来同时执行帧编码和检索索引构建。在流处理过程中,ShallowStream 使用浅层的 KV 缓存来维护始终在线的轻量级索引。在查询时回答期间,我们利用浅层生成的注意力分数对上下文框架进行评分,并采用多样性感知选择策略来检索精确且全面的证据。 ShallowStream 的性能可与现有最强大的流媒体方法相媲美,同时将每帧预填充延迟和 10 秒端到端延迟分别减少高达 52.1 倍和 11.9 倍。我们的代码可在 https://github.com/CURRENTF/ShallowStream 获取。