论文
FlashBack:知道何时在流视觉语言模型中记住
FlashBack: Knowing When to Remember in Streaming Vision-Language Models
摘要
流式视觉语言模型必须在有限的计算预算下处理不断增长的视频流,从而在实时感知和长期记忆之间造成持续的紧张关系。检索历史信息提供了一种自然的补救措施,但历史回忆并不总是有益的:不必要的历史可能会将不相关的上下文引入当前推理中,并干扰本地实时感知。因此,有效的流式内存不仅应该解决要记住的内容,还应该解决何时以及如何访问它。为此,我们引入了 FlashBack,这是一种无需训练的框架,用于流式视觉语言模型中的选择性多级记忆。在检索历史之前,FlashBack 利用冻结流式 VLM 的语义理解来推断查询是否需要历史证据。此评估确定推理是否保留在本机轨迹上或调用隔离的召回轨迹。 Recall 轨迹通过查询本地 Side-KV 路径将最近的上下文与检索到的长期记忆结合起来,保留本地时间连续性而不修改持久的本机状态。我们在 StreamingVLM 和 Mage-VL-4B 上实例化 FlashBack,并在 OVO-Bench 和 StreamingBench 上对其进行评估。结果显示,在几个长期和依赖于内存的任务上有所改进,同时在很大程度上保留了实时感知,尽管不需要额外的训练,但其性能与基于训练的流方法相比具有竞争力。我们的代码将在稍后公布。