论文

Honeycomb:视频世界模型的恒定大小场景记忆表示

Honeycomb: Constant-Size Scene Memory Representation for Video World Models

摘要

视频世界模型需要持久的场景内存,以在长视域视频生成过程中保持一致性。现有的空间记忆会积累 RGB 观察结果或潜在特征,随着生成的进行而增加存储需求。我们引入了 Honeycomb,这是一种基于 HexMemory 构建的视频世界模型,HexMemory 是我们提出的低秩表示,用于将场景特征存储在固定大小的内存中,总共有六个空间和时空平面。前馈写入器将每个生成的块映射到新的平面特征中。随着空间覆盖范围或时间范围的扩大,我们在保留其尺寸的同时扭曲先前的平面,然后通过置信加权池和学习的残差校正将它们与新特征融合。读取器从 HexMemory 检索潜在数据以调节后续视频生成。作者仅处理来自新块的观察,避免了每个场景的优化和完整历史记录的重复处理。 WorldScore 和 RealEstate10K 上的实验展示了强大的视频生成质量和强大的重访一致性,同时保持 HexMemory 特征存储在整个生成过程中保持恒定。代码和其他可视化可在我们的项目页面 https://jackswl.github.io/honeycomb/. 上找到