论文

具有证据一致的时间和透明决策的渐进式在线视频理解

Progressive Online Video Understanding with Evidence-Aligned Timing and Transparent Decisions

摘要

当足够的证据首次出现在视频流中时,在野外运行的视觉代理必须准确地响应查询,这是在离线设置中评估的传统视频 LLM 忽略的关键功能。向在线流媒体范式的转变带来了重大挑战:缺乏决策透明度、难以将响应时间与视觉证据保持一致,以及需要在紧张的计算预算下保持全局的、因果一致的理解。为了解决这些问题,我们提出了一种新颖的框架,将推理控制与内存集成分离。我们引入 \textbf{\model{}},这是一个具有两个核心组件的框架的实例。首先,\emph{主动思维决策者 (ATDM)} 是一个透明的推理控制器,它使用可观察的进度 ($\boldsymbolρ$) 和置信度 ($\boldsymbol{c}$) 指标来具体化其决策过程。这使得它能够精确地计算其响应 $t_r$ 的时间,以匹配第一充分证据时间戳 $t^\star$,同时将其推理流式传输给用户。其次,\emph{层次渐进语义集成(HPSI)}模块充当高效的记忆系统。它采用一组可学习的多级聚合标记,这些标记在剪辑之间传播,以构建丰富的全局认知状态,而不会超过 词元预算。我们的方法为关键在线视频理解基准设定了新标准,在 StreamingBench 上实现了 \textbf{71.6\%} ,在 OVOBench 上实现了 \textbf{46.9\%} 的强大性能,展示了用于证据对齐和透明在线视频分析的强大解决方案。大量实验证明了 ATDM 和 HPSI 的有效性,例如,Thinking-QwenVL 在 StreamingBench 基准测试上将之前最先进的准确率从 67.63\% 提高到 71.60\%。