论文
基于仿真数据集与双流光流监督的物理一致流体视频生成
Physics-Grounded Fluid Video Generation with a Simulation Dataset and Dual-Stream Optical-Flow Supervision
摘要
视频扩散模型能生成视觉上引人入胜的内容,但当主体涉及流体时常常违反基本物理:液柱在半空中断裂、向容器倒入液体时水位不上升、飞溅无视动量与重力四散。我们把这一差距归因于大规模视频-文本语料几乎不含显式运动监督,模型因此学会模仿流体的外观而非动力学。我们以两项贡献解决该问题。首先,我们构建了一个物理仿真流体数据集,将1,638段MPM仿真的倾倒/晃动视频与从素材库中挖掘的2,320段按关键词过滤的真实倾倒视频相结合,另附两个留出测试集:一个1,515视频的真实视频基准和一个18提示的文本到首帧泛化基准。其次,我们提出一个构建于预训练diffusion-transformer视频生成器之上的双流图生视频架构。它在标准RGB解码器之外增加一个轻量光流解码器分支,以显式的端点误差与平滑度损失训练,并通过零初始化卷积融合进RGB流,使预训练骨干在起始时不受扰动。仅更新这两个解码器;编码器、时间transformer与文本编码器保持冻结。在两个模型规模(1.3B与14B)和两个测试集上,我们的方法将VideoPhy-2物理常识与视频质量分数相较冻结骨干最多提升8.75与4.65分,超越一个领先的开源竞争者,并在盲测中获得人类评分者偏好。直接的光流读出评估进一步显示分布内端点误差低至0.54像素,证实模型内化了连贯的运动先验,而非仅仅改善表面外观。
