论文

Fluid-Gen-Zero:无需训练即可在物理学中奠定预训练视频生成器的基础

Fluid-Gen-Zero: Grounding Pretrained Video Generators in Physics without Training

模型推理智能体系统应用与实践解码与生成控制Agent 规划内容创作

摘要

我们提出了 Fluid-Gen-Zero,这是一种无需训练的物理感知流体对象交互视频生成框架,可将物理推理与外观合成分离。我们的主要见解是将运动动力学委托给物理模拟器,同时保留预训练视频生成器的外观建模能力。我们通过两级 agentic 工作流程桥接这两个领域:生成时规划,其中视觉语言模型 (VLM) 代理解释意图和模拟推出以组织生成剪辑,以及潜在空间引导,通过区域感知潜在包装将模拟信号注入去噪。这种即插即用的设计与当前的视频基础模型兼容。我们进一步介绍了流体-对象交互视频生成的基准。在 Tora(基于 CogVideoX)、VACE 和 WanMove(基于 Wan)中,Fluid-Gen-Zero 持续改进了模拟对齐,将物体轨迹误差减少了 26.7%-81.5%,将流体 fEPE(流体流动端点误差)减少了 67.9%-84.0%,同时在很大程度上保持了感知质量。在人类 偏好研究显示,在三个骨干网的同骨干比较中,评分者青睐 Fluid-Gen-Zero 的比例为 55.1%-74.4%,在与基于模拟的方法的比较中,评分者的比例为 90.4%-94.2%。代码和数据将在接受后发布。