论文

跟踪噪声,推动世界:受3D几何约束的运动一致噪声,用于生成可控视频

Track the Noise, Move the World:3D-Grounded Motion-Consistent Noise for Controllable Video Generation

应用与实践内容创作

摘要

现代图像和文本到视频的扩散模型可以通过迭代地对基于参考图像和文本输入的初始高斯噪声张量进行去噪来合成高度逼真的视频。然而,现有方法仍然缺乏对单次生成过程中的物体运动和相机运动的精确和统一的控制。我们提出了 UniCaMo,一个统一的框架,可以通过直接构建扩散模型的输入噪声来同时控制对象轨迹和相机视点。具体来说,UniCaMo 在潜在视频帧上构建了一个共享的 3D 基础运动一致噪声空间。稀疏 3D 点轨迹用于沿着所需的对象轨迹扭曲参考帧的高斯噪声,而虚拟球形噪声表示为相机运动下新显示的场景区域提供全局一致的噪声值。通过将局部轨迹引导噪声扭曲与基于全局球体的噪声采样相结合,UniCaMo 在对象移动和视点变化下保持几何和时间一致性。由于 UniCaMo 仅修改输入噪声,因此不需要辅助适配器、控制分支或对底层视频扩散模型进行架构更改。通过在大型预训练视频扩散模型(包括 Wan 2.1 (14B))上使用轻量级 LoRA 微调,UniCaMo 在标准可控视频生成基准上的视频质量和运动可控性方面取得了最先进的结果。