论文

SPW-Nav:语言引导的流式全景世界模型

SPW-Nav: A Streaming Panoramic World Model for Language-Guided Navigation

模型训练上下文与知识应用与实践参数高效训练记忆内容创作

摘要

语言引导的全景视频生成有利于各种下游应用,例如交互式 3D 场景探索、虚拟现实体验和实体Agent培训。现有的全景生成器遵循预定义的轨迹,交互式世界模型通过透视视图中的低级动作进行操作。我们提出了 SPW-Nav,一种流式全景世界模型,可以理解运动指令并从单个全景图中实时流式传输一分钟的 2K 360 度视频。 SPW-Nav 将先前生成的全景图中的每条指令解释为相机运动。球面旋转解耦精确地在球体上应用旋转,姿势对齐调节使平移输入在长流上保持有界,并且具有几步生成器的多项存储器在指令变化时继续场景。我们还构建 SPW-NavSet、带有摄像机轨迹和经过验证的指令的全景视频。在语言驱动下,SPW-Nav 在摄像头跟随精度和视频质量方面优于之前的全景生成器,并支持即时指令切换。

SPW-Nav:语言引导的流式全景世界模型:论文原图
图 2:SPW-Nav 管道概述。导航。视觉语言主干在最新的全景图中定位参考目标(框)I¯k−1\bar{I}_{k-1} 并输出相机轨迹 (R,𝐭)(R,\mathbf{t})。视频生成。长、中、短范围的记忆标记以及块 kk 的噪声潜伏进入扩散变换器,并且姿势标记 𝐩k,j\mathbf{p}_{k,j} 表示相对于参考系 ρk\rho_{k} 的 𝐭\mathbf{t}。该块按照最粗尺度的指导 v^\hat{v} 从粗到细进行去噪。球面旋转解耦。旋转 RR 绕过视频主干(虚线)并通过球形重采样应用于无旋转输出。最后一帧 I¯k\bar{I}_{k} 被反馈用于下一条指令(实线)。