论文

视频世界模型的可寻址内存

Addressable Memory for Video World Models

模型推理KV Cache

摘要

我们研究交互式视频世界模型中的视觉暂留。这些模型依靠键值 (KV) 缓存作为不断增长的视觉记忆来继承先前生成的帧。然而,我们发现,一旦生成轨迹超出训练范围,模型就无法再可靠地处理存储的内容,因为时间旋转位置嵌入(RoPE)偏移量会超出训练期间看到的范围,并且模型很难通过注意力检索相关的视觉信息。此外,简单地压缩 RoPE 旋转空间中的缓存会通过将不兼容的位置相位平均在一起来破坏内存。为了解决这个问题,我们提出了 WorldTrace,这是一种用于长视野视觉暂留的 无需训练 内存框架。 WorldTrace 通过为每个摘要槽分配一个独特的分布内虚拟位置来保持压缩内存的可寻址性。在这个可寻址缓存中,我们研究了两种内存压缩方法:WorldTrace-Field 压缩历史记录以实现时间一致性,而 WorldTrace-Landmark 则在检测到的转换处存储逐字场景痕迹以实现情景回忆。我们进一步介绍了 LoopBench,这是一个评估压缩缓存是否可以在长途绕行后重建先前访问过的场景的基准测试。 WorldTrace-Field 将 LoopBench 上的时间一致性提高了 15.5%,WorldTrace-Landmark 将 LoopBench 上的情景召回率提高了 19.5%,无需重新训练即可扩展视觉持久生成。