论文
在野外利用流媒体视频
Harnessing Streaming Video in the Wild
摘要
在视频通话助手、现场评论和实体机器人等应用中,越来越需要视觉语言模型 (VLM) 来处理无界视频流。理想的流媒体系统应该支持主动交互、长范围内存和实时处理,同时依靠能够处理各种野外流媒体任务的 VLM 主干网络。然而,现有的 VLM 在离线视频理解方面表现出色,但在流媒体功能方面存在不足,并且缺乏用于流媒体部署的专用基础设施。我们从三个方面解决这一差距。 (i) 对于主干能力,我们构建了 \textbf{Streaming-Train-248K},这是一个流数据集,与一个新颖的训练目标配对,用于使 VLM 适应流交互和理解。 (ii) 对于实际部署,我们引入了 \textbf{Streaming Harness},这是一种即插即用系统,赋予任何 VLM 三种核心能力:主动交互(每秒响应决策)、长期记忆(12 小时上下文保留)和实时处理(亚秒级延迟)。 (iii) 为了推动社区在流媒体功能方面的持续进步,我们设计了 \textbf{Streaming-Eval},这是一个反映模型在不同野外场景中的能力的基准。大量的实验表明,我们的方法在流视频理解所需的所有核心功能上都取得了一致的收益。我们将开源我们的数据、代码和基准,以推动社区从离线视频理解向可部署的流智能的转变。