论文

流媒体视频理解的简单基准

A Simple Baseline for Streaming Video Understanding

模型评测模型能力评测

摘要

最近的流视频理解方法越来越依赖复杂的内存机制来处理长视频流。我们通过一个简单的发现来挑战这一趋势:仅将最近的 N 帧提供给现成的 VLM 的滑动窗口基线已经匹配或超过了已发布的流媒体模型。我们将此基线形式化为 SimpleStream,并在 OVO-Bench 和 StreamingBench 上对照 13 个主要离线和在线视频 LLM 基线对其进行评估。尽管简单,SimpleStream 仍能提供始终如一的强大性能。仅使用最近 4 帧,在 OVO-Bench 上达到 67.7% 的平均准确率,在 StreamingBench 上达到 80.59% 的平均准确率。受控消融进一步表明,较长上下文的价值是依赖于主干的,而不是随着模型规模的增加而均匀增加,并揭示了一致的感知-记忆权衡:添加更多的历史上下文可以提高召回率,但通常会削弱实时感知。这表明更强的内存、检索或压缩模块不应被视为进步的证据,除非它们在相同协议下明显优于 SimpleStream。因此,我们认为未来的流媒体基准测试应该将最近场景的感知与远程记忆分开,以便可以更清楚地评估复杂性增加带来的性能改进。