论文
压缩和检索:视频世界模型的隐式内存检索
Compression and Retrieval: Implicit Memory Retrieval for Video World Models
摘要
视频世界模型有望模拟交互式环境,但在复杂的摄像机轨迹上保持一致的长期记忆仍然是一个严峻的挑战。现有方法通常依赖于计算昂贵的上下文缩放或严格的启发式检索机制,缺乏对不同相机轨迹和环境的泛化。在本文中,我们提出了压缩和检索(CaR),这是一种注意力驱动的内隐记忆检索机制来克服这些限制。通过位置编码注入视点信息,我们的方法通过注意力计算执行灵活的记忆检索。为了以最小的计算开销有效地处理扩展上下文,我们进一步引入了轻量级上下文压缩网络。此外,我们构建了 SceneFly,这是一个大规模合成数据集,具有真实的相机轨迹和帧级注释,用于训练和评估长视野视频世界模型。大量的实验表明,我们的方法在既定基准上取得了最先进的结果,并对开放域场景表现出强大的泛化能力。