论文

用于高度可控视频生成的世界叙事模型:从像素采样到物理世界编排的范式转变

World Narrative Model for Highly Controllable Video Generation: A Paradigm Shift from Pixel Sampling to Physical World Orchestration

应用与实践内容创作

摘要

工业级视频生成的根本障碍是缺乏可控性:现有模型将视频视为像素分布采样问题,绕过了明确的实例级 $4D$ $(3D + T)$ 物理世界。因此,内容创建者无法以确定性、定量的方式指定几何形状、运动、相机参数或照明,从而导致臭名昭著的“gacha”循环,使专业内容创建效率极低且昂贵。为了解决这个问题,我们引入了世界叙事模型(WNM),这是一种将渲染内容(结构化物理叙事)与如何渲染(像素生成过程)分离的范例。 WNM 用精心策划的 4D$ 媒体生成预可视化取代了端到端黑盒采样。协作代理将稀疏的多模态输入(包括文本、参考视频和草图)转换为完全可编辑的世界表示,其中包含场景几何、对象布局、角色/动物骨骼运动、轨迹、相机运动和定量的、具有物理意义的粒度的照明。这种表示形式充当确定性的结构蓝图,驱动现有的视频基础模型(无论是冻结的还是轻微调整的)来渲染最终镜头,将基础模型转变为忠实的神经着色器。建立在该引擎之上,我们的人类人工智能平台支持与专业电影制作流程相一致的自动世界生成和预可视化,而导演控制台则可实现无缝的人类细化。实验表明,WNM 极大地减少了“扭蛋”调用的概率,并生成布局、动作和摄影密切遵循创作者意图的视频。该框架是开放式和模块化的,允许独立改进每个组件,例如世界表示、控制代理和适配器。项目网站:https://glassroom.sjtu.edu.cn/WNM/。