论文

STRIDE:何时说话与流视频理解的序列去噪相结合

STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding

模型推理解码与生成控制

摘要

视频 大语言模型 (Video-LLM) 的最新进展实现了对长而复杂的视频的强大离线推理。然而,现实世界的部署越来越需要流感知和主动交互,其中视频帧在线到达,系统不仅必须决定响应什么,还必须决定何时响应。在这项工作中,我们将流视频中的主动激活重新视为结构化序列建模问题,其动机是观察到流视频中的时间转换自然形成跨度结构化激活模式。为了捕获这种跨度结构,我们在滑动时间窗口上联合建模激活信号,并在新帧到达时迭代更新它们。我们提出了 STRIDE(具有迭代去噪的结构化时间细化),它在激活接口处采用轻量级掩模扩散模块来联合预测并逐步细化整个窗口的激活信号。对各种流媒体基准和下游模型的大量实验表明,STRIDE 显示出更可靠且时间一致的主动响应,显着提高了在线流媒体场景中何时发言的决策质量。