论文

CT-1:视觉语言相机模型将空间推理知识转移到相机控制的视频生成中

CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation

应用与实践内容创作

摘要

相机控制的视频生成旨在通过灵活且物理上合理的相机运动来合成视频。然而,现有方法要么通过文本提示提供不精确的相机控制,要么依赖劳动密集型的手动相机轨迹参数,限制了它们在自动化场景中的使用。为了解决这些问题,我们提出了一种新颖的视觉语言相机模型,称为 CT-1(相机 Transformer 1),这是一种专门的模型,旨在通过准确估计相机轨迹将空间推理知识转移到视频生成中。 CT-1 基于视觉语言模块和扩散 Transformer 模型构建,在频域中采用基于小波的正则化损失来有效学习复杂的相机轨迹分布。这些轨迹被集成到视频扩散模型中,以实现符合用户意图的空间感知相机控制。为了促进 CT-1 的训练,我们设计了专用的数据管理管道并构建了 CT-200K,这是一个包含超过 47M 帧的大型数据集。实验结果表明,我们的框架成功弥合了空间推理和视频合成之间的差距,产生了忠实且高质量的摄像机控制视频,并将摄像机控制精度比现有方法提高了 25.7%。