论文
ObjectStream:潜在对象作为流视频理解的内存锚点
ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding
摘要
流媒体视频理解要求模型在知道未来的问题之前不断保留有用的视觉证据。现有的方法主要根据词元重要性、时间冗余或片段级相关性来管理不断增长的视觉上下文,但很少围绕随时间持续和演变的对象组织证据。因此,在本文中,我们介绍了 ObjectStream,这是一个 无需训练 框架,它将潜在对象视为流视频理解的内存锚点。 ObjectStream 直接从冻结的 Video-LLM 表示中引入空间相干的潜在对象,将它们跨帧链接到持久锚点中,并在有限的内存预算下维护它们的历史,而不需要外部对象检测器或分割模型。基于这些锚点,ObjectStream 保留了三种互补形式的证据:持久对象历史、瞬时对象更改和最近的视觉上下文。此设计使现有的 Video 大语言模型 (Video-LLM) 能够推理对象身份、交互和状态更改,同时保持底层模型不变。对在线流媒体和离线长视频基准的大量实验证明了有效性和效率。在在线流评估中,ObjectStream 在 OVO-Bench 实时视觉感知上将 Qwen2.5-VL-7B 提高了 10.0 分,同时将峰值 GPU 内存和 TTFT 降低了约 50%。在离线长视频基准测试中,它超越了全词元基线,同时丢弃了 82.5% 的视觉词元。这些结果强调了潜在对象作为紧凑流视频内存的实用且有效的组织原则。