论文

StateFlow:构建、演进和访问 3D 世界状态以进行预可视化

StateFlow: Building, Evolving, and Accessing 3D World States for Previsualization

智能体系统Agent 架构与控制循环

摘要

预可视化是电影、游戏、建筑和城市设计中创意和制作之间的中间层。它让创作者能够迭代地完善场景、动作、摄像机和时空动态。然而现有的生成方法依靠简单的提示,通过一次性图像或视频合成来共同控制所有这些因素,可控性较弱,对迭代编辑的支持有限。从根本上来说,世界由具有几何、外观和其他属性的多个元素以及相机组成。不同的帧是通过对该共享状态进行本地修改或重组而产生的,否则该共享状态将被大量重用。因此,我们认为缺失的组件是一种明确且持久的工作状态。为了解决这个问题,我们提出了 StateFlow,一个用于生成预可视化的以状态为中心的框架。 StateFlow 不是一次性生成视频,而是使用可编辑的 3D 世界来组织场景结构、演变和摄像机,而现成的视频模型可以在需要更高保真度时增强视觉质量。这个世界被维护为场景元素和摄像机配置的持久结构化 3D 状态,作为预可视化的核心工作表示。基于这一见解,StateFlow 分为三个阶段来构建、演化和访问世界状态。状态构建通过预先引导、冲突感知的双视图初始化将生成的 2D 内容提升到连贯的 3D 世界,而状态演化将用户意图转换为结构化状态转换,同时保留世界记忆,避免每次编辑的全场景重新生成。状态访问使用渲染反馈反射将摄像机计划细化为视觉上可行的轨迹,避免单独依赖 VLM 语义。实验表明,StateFlow 可以为视频创作和游戏原型制作生成高质量的 3D 世界。