论文
ChronoStitch:用于长视野时间推理的视觉 KV 记忆的 无需训练 组合
ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning
摘要
长视频问答需要一个模型能够随着时间的推移保留视觉证据,而无需重复重新处理同一视频。一种实用的方法是存储每个视频块的视觉语言模型的内部键值 (KV) 缓存,并在查询时检索该状态。然而,独立缓存的视频块无法正确组合:每个块都是从本地旋转位置零开始预填充的,因此简单的串联会与时间相位发生冲突,并消除了有关首先发生的事情、事件发生的频率或视频中发生的变化等问题所需的全局顺序。本文提出了 ChronoStitch,一种用于构建独立存储的视觉 KV 存储器的 无需训练 方法。该方法首先将存储的后旋转密钥重新设置到全局三轴多模态 RoPE 坐标系上,该坐标系保留时间、高度和宽度结构。我们展示了为什么一维标量重新索引对于视觉标记来说在几何上是不一致的,因为它将帧内的空间顺序变成了错误的时间位移。然后,我们解决位置修复留下的残留内容间隙:后面的块最初是编码的,而不关注前面的块。因此,ChronoStitch 有选择地重新计算一小部分高偏差后块视觉标记,同时允许它们参与组合缓存。在 Qwen2.5-VL-3B 和 TempCompass 的时间分割上,ChronoStitch 的性能优于朴素合成和仅位置变体,提高了事件排序的准确性,同时运行速度比完全联合预填充快 3.3 倍。