论文

为世界模型构建预训练数据:基于虚幻引擎的动作条件视频生成管道

Building Pretraining Data for World Models: An Unreal Engine-Based Pipeline for Action-Conditioned Video Generation

AI 基础设施数据基础设施

摘要

动作条件视频模型需要大规模视觉数据与控制信号配对,这些控制信号在时间上与所产生的场景转换保持一致。这种监督很难从普通的现实世界视频中获得,因为导致每次视觉变化的动作通常是未知的。我们提出了一个基于虚幻引擎构建的大规模合成数据生产管道,用于生成动作调节的多视图视频。为了适应实时物理和高质量离线渲染的不同执行要求,该管道分两个阶段执行轨迹生成和最终渲染:第一阶段在 PIE 中运行真实物理,并将每帧角色状态、控制输入和相机状态记录到中间轨迹表示中; Stage II 在新的引擎进程中重播这些轨迹,并使用电影渲染队列 (MRQ) 离线渲染它们。围绕这个核心,我们开发了一个分布式生产系统,具有缓存感知任务分区、节点本地槽调度、自动场景筛选、美学和亮度过滤、部分输出恢复、异步上传和连续集群健康监控。生产集群包含 25 台服务器,每台服务器有 8 个 NVIDIA RTX 5090 GPU。从 2,384 个资源包中,保留了 429 个关卡以及 40 个人形角色用于制作。该管道已制作 2,691 小时的 1080p 视频和 6,076 小时的 720p 视频。我们描述了系统架构、因生产故障而产生的实施决策,以及使用感知质量代理进行世界模型数据管理的局限性。本报告中描述的管道构成了 EchoWM 中使用的虚幻引擎合成数据生产组件。