论文

StreamOV:通过证据引导记忆和响应触发来流式传输全视频理解

StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering

摘要

虽然流式全视频理解需要持续感知和主动、实时交互,但这一关键领域在很大程度上仍未得到充分探索。当前的全模态方法本质上是为离线设置而设计的,由于两个基本缺陷限制了它们在流媒体场景中的适用性。首先,它们缺乏强大的机制来长期管理不断增长的视听环境,并且无法在适当的时刻自主发起响应。其次,现有的基准主要局限于离线、单轮问答,无法捕获连续、多轮流式交互。为了弥补这些差距,我们提出了 StreamOV,这是一种新颖的流式全视频理解框架,可通过有限内存和主动响应触发进行高效的在线视听推理。具体来说,StreamOV 引入了多模态证据引导的长期短期记忆,可在固定预算下将历史视听上下文浓缩为紧凑的信息证据。它还采用隐藏状态驱动的触发器来决定何时响应,避免显式的静默词元生成和外部路由器。我们还策划了 SOVBench,这是第一个在线、多轮全模式评估的综合基准。大量实验表明,StreamOV 在各种流媒体和全视频基准测试中实现了最先进的性能,证明了其对在线和离线视频理解的有效性。