论文
AlayaVista:从全景状态到透视视频的流式世界建模
AlayaVista: Streaming World Modeling from Panoramic States to Perspective Video
摘要
交互式视频世界模型必须在摄像机运动下保持广泛的场景上下文,同时以低延迟生成高保真观察结果。现有方法面临着表示权衡:透视模型在局部视图上运行,并且必须在长时间部署中保留屏幕外内容,而更广泛的空间覆盖范围通常是通过合成全球视频或构建显式 3D 表示来获得。受全球背景和选择性局部敏锐度在视觉感知中互补作用的推动,我们提出了 AlayaVista,一种摄像机控制的流媒体视频世界模型,它将全景世界演化与透视观察合成解耦。给定单个透视图像,AlayaVista 使用预训练的全景扩展模型先构建 360 度场景,然后将该场景演化为相机调节的全景潜在状态。潜在视口渲染器将此状态映射到请求的透视视频潜在,而透视细化器则恢复细节、抑制伪像并执行超分辨率。为了支持高效的流媒体,我们将全景生成器调整为块自回归生成,并将全景生成和透视细化提炼为几个步骤的过程。为了提供此设计所需的监督,我们构建了 MUGEN,这是一个大型真实世界全景视频数据集,包含 1,318 小时的视频,分辨率至少为 4K,以及丰富的语义和几何注释。