论文

Sekai2:从世界探索到交互式世界建模

Sekai2: From World Exploration to Interactive World Modeling

模型训练合成数据

摘要

视频世界模型需要学习场景随时间与视角变化的规律,因此长程生成与相机控制训练需要同时提供长视频、相机轨迹和时间对齐的语义。现有网络视频缺少轨迹与时间文本,位姿标注数据则多为短片段或面向重建。Sekai2包含113个国家或地区、10428个源视频的128892个片段,共2826小时。数据偏重持续观察:按统一120秒规则切分时,43594段达到完整两分钟,占全部视频时长的51.4%。每段都提供相机轨迹和分层标注,区分主体运动、环境动态、静态场景与相机行为,形成649597个时间对齐的语义片段。数据还包含982条沿非线性路径拍摄、带闭环与重访的全景序列,使相同地点可在不同时间和视角重复观察,支持持久场景表示、长期空间记忆及几何一致世界模型学习。语料分析显示位姿与描述覆盖完整,地理和语义分布广泛,相机轨迹多样、时间描述冗余较低,可用于长程视频生成、相机可控合成与交互式世界模型预训练。