论文

流视频模型应该记住什么?

What Should a Streaming Video Model Remember?

摘要

流视频理解模型必须在正在进行的流中随时回答查询,仅使用迄今为止观察到的内容并在固定的内存和计算预算下。现有方法通过添加内存库、检索模块或视觉词元压缩来保存长期历史记录来解决这个问题。然而,强大的最近窗口基线表明,不加区别的历史注入会稀释当前场景的感知,这表明关键的挑战不是是否使用内存,而是如何有选择地分配内存。我们将其表述为预算在线潜在证据分配,并提出 \textbf{SelectStream},这是一种选择性潜在记忆框架,使当前观察结果对冻结的 VLM 直接可见,同时仅通过紧凑的、查询条件的证据预算公开历史信息。三种协调机制控制何时写入、保留什么以及如何检索:意外驱动的自适应窗口、保留优先级的合并以及对固定容量潜在内存图的查询条件图推理。检索到的证据经过校准并作为答案生成的潜在标记注入,无需重播帧或随流长度增长上下文。实验结果表明,SelectStream 实现了强大的在线流性能并保留了一般视频理解,在 StreamingBench 上达到 82.67\%,在 OVO-Bench 上达到 67.03\%,在离线视频基准上达到 74.4\% 的平均准确率,同时优于强大的最近窗口基线和先前的流内存方法。