论文
用于流媒体视频理解的语义感知自适应视觉记忆
Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding
摘要
在线流视频理解需要模型能够处理连续的视觉输入并实时响应用户查询,其中无界流和不可预测的查询时序将记忆管理变成了一个核心挑战。现有方法通常通过视觉相似性启发法来压缩视觉标记,或者通过 KV 缓存级检索来增强压缩。然而,压缩决策很少包含语义信号,并且通常在压缩完成后添加检索,使得这两个阶段难以协调。我们提出了 SAVEMem,这是一个 无需训练 双阶段框架,它将语义意识引入记忆生成,并让检索范围适应每个查询。在Stage~1中,SAVEMem在恒定的内存预算下在线构建了三层流式记忆。固定的伪问题库提供了轻量级的语义先验,因此长期保留是由语义显着性而不是单独的视觉相似性决定的。在 Stage~2 中,SAVEMem 对此记忆执行查询感知检索。锚条件的新近度门根据查询是针对现在还是遥远的过去来调整检索范围从短期记忆到中长期记忆。在此范围内,查询和记忆标记之间的后期交互会选择候选帧进行回答。在未经训练的情况下应用于 Qwen2.5-VL,SAVEMem 将 OVO-Bench 总体得分从 52.27 提高到 62.69,并在 StreamingBench 和 ODV-Bench 上获得一致的增益,同时在骨干网上 128 帧时将峰值 GPU 记忆减少 48%。