论文

MEMO:用于流视频理解的多级实体感知记忆

MEMO: Multi-Level Entity-Aware Memory for Streaming Video Understanding

摘要

流视频理解需要模型处理无限的视觉流,同时在广阔的时间范围内保留丰富的视觉语义,这对记忆建模提出了根本性的挑战。现有方法主要侧重于增加记忆容量,方法是将历史信息压缩为固定大小的表示形式,或者将存储扩展到 GPU 记忆之外。然而,这些方法很大程度上依赖于全局或粗粒度的表示,不可避免地会丢失细粒度的视觉信息。在这项工作中,我们认为流视频记忆应该显式编码结构化和语义上有意义的表示,特别是在实体级别。为此,我们提出了 MEMO,这是一种通过多级实体感知结构化记忆对流视频进行建模的新颖框架。 MEMO 执行多层次感知,共同捕获全局语义、实体动态和空间结构,将流视频划分为语义连贯的块。每个块都被组织成结构化记忆,其中轻量级全局和实体级表示充当检索索引,而相应的高分辨率视觉内容则单独保留以供按需访问。在推理时,MEMO 对结构化记忆执行特定于查询的检索,并选择性地回忆相关视觉证据以进行下游推理。值得注意的是,MEMO 无需训练,并且可以与现有的多模态大语言模型即插即用。 StreamingBench 和 OVO-Bench 上的大量实验表明,MEMO 持续改进了多个基础模型并实现了最先进的性能。