论文

不要暂停:流媒体视频语言同步用于在线视频理解

Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding

模型推理解码与生成控制

摘要

在线视频 大语言模型 (Video-LLM) 通过逐帧处理和主动响应,实现了无缝人机交互。然而,流媒体场景中仍然存在一个关键挑战:现有模型通常会在生成响应时暂停视频感知,破坏实时视频语言同步并导致卡顿。为了解决这个问题,我们引入了一种新颖的在线视频理解范例:流视频语言同步(SVLS),并推出了 LyraV,一种基于分层控制框架构建的实时流媒体助手,具有两项核心创新。首先,帧驱动转换控制器 (FDTC) 是一种基于 无需训练 验证的有限状态机,它对何时继续说话、开始新响应或保持沉默做出高级语义决策。其次,Streaming Token Pacer (STOP) 是一种即插即用的轻量级预测模块,可动态调整语言生成速率以匹配视觉内容的节奏。具体来说,LyraV 执行 \emph{每帧增量、子预算解码}:在每个帧间隔内,它只发出一小块适合实时预算的标记,因此感知永远不会被整个句子阻塞。这些组件共同使 LyraV 能够将传入的视频帧与生成的单词标记无缝交错,从而实现细粒度的同步。对五个在线和三个离线基准进行的大量实验表明,LyraV 保留了主干的总体理解能力,同时大幅提高了流媒体同步性和叙事流畅性,实现了 98.29% 的视频播放同步性和 3.89 FPS 的实时处理速度。有趣的是,我们观察到 LyraV 的经验能力:对流词元的动态推理,实现与视觉输入一起的连续解释和“思考”。