论文
FastBench:流式 VLM 能否感知高动态的现实世界流?
FastBench: Can Streaming VLMs Perceive High-Dynamic Real-World Streams?
摘要
流视频大语言模型 (VLM) 可实现连续视频理解,但现有基准测试侧重于低动态场景。在有界上下文预算下,模型必须平衡时间历史、空间分辨率和时间粒度; 1--2 FPS 的稀疏采样会错过快速事件。我们引入 FastBench 来评估现实视频流中的高动态感知。其基于轨迹的管道结合了高 FPS 剪辑的 QA 生成、以 2 FPS 过滤可回答的问题、使用 SAM3 和 CoTracker3 轨迹进行答案验证以及三轮人工检查。 FastBench 包含 306 个 QA 对,跨越 8 个领域、6 种功能以及前向、即时和后向时间范围,并具有人工注释的证据区间。我们还推出了 ProactiveFrame,这是一种无需训练的基线,可通过文本标记调整传入帧速率。双层滑动窗口保留最近的高 FPS 观测值,同时将较旧的观测值下采样到稀疏历史记录中。实验揭示了巨大的局限性:最强的模型 Gemini-3.5-Flash 仅得分 50.7%。更密集的采样将 Qwen3-VL-8B 从 2 FPS 时的 32.9% 提高到 24 FPS 时的 44.6%,但随着历史记录的压缩,增益会饱和。 ProactiveFrame 的性能优于稀疏均匀采样 5.4 和 1.5 个百分点,但仍远低于预言机引导的聚焦,这表明当前的 VLM 很难仅从流中确定何时需要更精细的时间感知。 FastBench 提供了一个用于高动态流视频理解的测试平台。代码和数据:https://github.com/Ashone3/FastBench.