论文
FOLIO:用于流媒体视频理解的集中语义记忆
FOLIO: Focused Semantic Memory for Streaming Video Understanding
摘要
在在线流视频理解中,视频流不断到达,并且随时可能发出查询。由于流帧无限增长,系统必须不断压缩并保留来自观察到的视频前缀的信息,而未来的帧和未来的查询仍然未知。核心挑战是决定保留哪些信息以及如何组织维护的历史记录:随着历史记录随流增长,内存成本增加,并且保留许多冗余的视觉细节,而后续查询通常依赖于特定的实体、操作及其时间变化。为了应对这一挑战,我们引入了 FOLIO,这是一种专注于 无需训练 的语义记忆系统,它可以更详细地记录流的重要部分,同时保持周围上下文的紧凑。当流到达时,FOLIO 在动态焦点状态的引导下更新段级别的内存,将短期视觉缓冲区与围绕观察到的实体组织并链接到视觉证据缓存的长期语义内存相结合。在查询时,轻量级混合检索将结构化内存上的直接匹配与语义查询扩展相结合。 FOLIO 实现了最先进的性能,在使用 Qwen3-VL-8B 的 OVO-Bench 上达到 82.0/69.1 感知/向后精度,在 StreamingBench 上达到 74.5 的整体精度,同时通过保留重点实体的详细记录并紧凑地存储周围上下文,大大降低了维护流内存的成本。