论文
4DStreamCtrl:通过在线 4D 控制生成交互式视频
4DStreamCtrl: Interactive Video Generation with Online 4D Control
摘要
生成视频模型现在合成的镜头几乎与现实没有区别。它们作为交互式工具的承诺取决于对对象和相机如何随时间移动的细粒度控制,但每种现有方法仅捕获其中的一部分:相机参数方法引导视点但不能移动对象,2D 轨迹方法在图像平面中起作用并忽略深度和遮挡,而最近的 3D 方法添加了几何形状但仅以固定长度离线运行。特别是,没有一个将相机和对象的 3D 一致控制与实时流生成结合起来。在这里,我们展示了相机运动、对象轨迹和深度可以统一为单个 3D 点轨迹表示,其中一个模型在单个前向传递中执行联合相机和对象控制、深度编辑和运动传输。为了大规模学习这个接口,我们挖掘野外视频进行 3D 运动监控,生成 OpenVidHD-Motion3D,并使用插入预训练视频扩散模型的轻量级几何运动头对其进行编码。由于该编码器是时间上可分离的,因此我们将模型提炼为因果流学生,该学生可以在与长度无关的内存中通过四个去噪步骤生成任意长的视频。这种统一设计在运动控制精度方面超越了之前的纯相机、2D 和离线 3D 方法,同时涵盖了它们仅单独处理的模式。 4DStreamCtrl 在单个高端 GPU 上以 20 FPS 的速度运行 480p 视频,并在数百帧上保持时间连贯性,据我们所知,首次实现了交互式 4D 可控流生成。更广泛地说,具有高效因果推理的显式 3D 几何的基础生成指向具有闭环时空控制的交互式世界模型,从可控模拟器到具体代理的实时视觉想象。