论文

StreamFlow:用于流式视频理解的动态内存流

StreamFlow: Dynamic Memory Flows for Streaming Video Understanding

摘要

流视频理解需要多模态 大语言模型 (MLLM) 来保存严格因果关系和有限内存下不断演变的流的相关证据。然而现有的范式仍然有限:基于模型的方法需要侵入性主干更新,而基于内存的方法在时间冗余内容上花费了大量的视觉编码计算,并依赖于对视觉历史的严格访问。为了解决这些限制,我们引入了 StreamFlow,这是一种高效的视觉记忆框架,可以动态、按需访问历史视觉信息。 StreamFlow 将轻量级、动态感知的中期记忆与潜在的长期记忆相结合,前者在视觉编码之前过滤时间冗余,后者将历史视频内容整合为后续推理可访问的视觉潜在内容。在生成过程中,当模型对视觉证据的依赖减弱时,注意力引导的检索机制会注入相关的视觉潜伏。 StreamFlow 实现了最先进的流媒体视频理解性能,在 StreamingBench 上达到 67.73% 的整体准确率,同时在离线长视频基准测试中也提供了强劲的性能。相对于普通设置,它提高了 59.1% 的视觉注意力评分 (VAS),同时将端到端延迟和峰值内存分别降低了 50.4% 和 21.1%,从而实现更加视觉化和高效的推理。