论文
MOSS-Video-Preview:通过交叉注意力实现实时视频理解
MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention
摘要
视频理解正在从离线范式(将完整录制的视频作为输入并在结束后生成单个答案)转向实时交互,其中模型在仍在回复的同时感知新帧,在新证据出现时修改其答案,并在无话可说时保持沉默。我们提出 MOSS-Video-Preview 来验证这个范例。我们的核心主张是,感知不能被世代所阻碍;它的自然实现是双通道架构。我们认为,交叉注意力主干比流行的仅解码器设计更适合实时视觉语言融合:视觉特征通过侧通道进入而不是加入自回归序列,因此感知和生成在单独的、非阻塞的路径上运行——降低视觉处理的频率并暴露干净的通道接口以进行独立压缩。我们通过数据合成管道来补充这一点,该管道将详细的视频描述转换为实时理解的 QA,其答案会被修改以匹配模型迄今为止所感知的内容,并且我们专门针对这些数据建立了离线模型以引发实时行为。我们的模型总体上落后于强大的 Qwen2.5-VL-7B 基线(我们将这一差距主要归因于数据和规模而不是架构),但获得了有竞争力的离线视频和多模式理解,在实时使用的空间和细粒度时间推理上保持稳健,并获得了离线模型缺乏的行为:持续感知、答案修订和及时沉默。在每个视频 256 帧的单个 H200 上,它实现了大约 5 倍的第一个词元时间加速和 2.7 倍的解码吞吐量,并且离线能力的下降可以忽略不计。我们对范式、架构和数据的研究概述了实现实时视频理解的可行路径。