论文
StreamTTT:协调流式 VLM 中的实时感知和长期记忆
StreamTTT: Reconciling Real-Time Perception and Long-Term Memory in Streaming VLMs
摘要
人类在记住过去的同时可以毫不费力地感知现在,但流式 VLM 常常会在实时感知与长期记忆之间进行权衡。先前的研究表明,缩短上下文可以增强当前场景的感知,但会牺牲远距离回忆。为了协调这些能力,我们引入了 StreamTTT,它将长期历史记录写入注意力上下文之外的在线更新的快速权重中。这留下了一个专门用于最近证据的短滑动键值缓存,从而减轻了注意力稀释。我们在离线长视频 QA 和新构建的实时 QA 语料库上联合训练 StreamTTT。在 OVO-Bench 上,在每个模型报告的输入协议下,StreamTTT-4B 在实时感知方面优于同规模的 SimpleStream-4B 0.6 分,在后向追踪方面优于同规模的 SimpleStream-4B 5.3 分。在 StreamingBench 的实时视觉理解 (RTVU) 子集上,它还超过了较大的 SimpleStream-8B 0.73 点。我们的代码可在 https://github.com/zeyun-zhong/StreamTTT 上公开获取。