论文

WorldCrafter:具有隐式 3D 感知内存的一致视频世界模型

WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory

摘要

视频世界模型可以对动态环境进行交互式探索,但很难尊重先前的长期观察和跨视角观察。我们提出了 WorldCrafter,这是一个视频世界模型,它可以为此目的学习可相机查询的隐式 3D 感知内存。关键的见解是让所请求的视点决定如何将多视图证据压缩到视频生成器有限的词元预算中。与视频生成器联合训练,内存编码器和姿势条件读出模块在去噪之前将历史观察结果集成到一组固定的目标视图特定标记中,而无需明确的基于深度的对应关系。通过将这种记忆与最近的时间上下文和几个步骤的蒸馏相结合,WorldCrafter 可以从单个输入图像或文本提示进行流式场景探索。静态和动态场景的实验表明,在长视距一致性和相机控制精度方面取得了显着的进步,同时在分钟尺度的探索过程中保持了视觉质量。