论文

PREM:用于长视频理解的前缀引导循环记忆

PREM: Prefix-Steered Recurrent Memory for Long-Video Understanding

摘要

长视频理解必须在严格的词元预算下捕获瞬态视觉证据,但现有方法会压缩帧、附加内存词元或更改内部键值 (KV) 缓存。我们引入了前缀引导循环记忆(PREM),这是一种用于冻结视觉语言模型(VLM)的无记忆词元框架。 PREM 将视频摄取与查询应答分开:循环写入器将视觉流提炼为紧凑的 256 KiB 多时隙关联状态,而问题条件读出则在预填充期间将内存派生的键/值 (K/V) 转向调制添加到现有的非视觉提示前缀。这使得一次写入、多次查询推理成为可能,无需额外的提示标记或解码重复。在离线和流媒体结束设置中的六个长视频基准测试中,PREM 在每个评估的视觉预算上始终优于冻结基线。在 16 帧的有限预算下,PREM 在 Qwen2.5-VL-3B 上将宏观平均准确率提高了 3.06%,动作反义词识别提高了 11.0%,局部针检索提高了 9.9%。这些增益需要在 0.03 GiB 峰值 GPU 内存开销下调整 0.24% 的主干参数。