论文

DeltaCam:用于视频生成的差分本征相机建模

DeltaCam: Differential Intrinsic Camera Modeling for Video Generation

模型推理解码与生成控制

摘要

将相机内在功能纳入视频生成模型提供了一种原则性的方法,不仅可以控制场景动态,还可以控制控制视觉外观的成像过程。之前的工作主要集中在外部控制,例如相机姿势和运动,同时将内部相机参数视为隐式或固定的。一个关键瓶颈是缺乏具有准确且多样化的随时间变化的相机元数据的大规模视频数据集,这使得学习绝对相机参数化变得困难。因此,当前的模型很难以可控且时间一致的方式整合摄影机行为,包括景深过渡、曝光变化、镜头畸变和颜色处理。我们引入了 DeltaCam,这是一种视频扩散框架,它通过 $Δ$ 参数化神经相机适配器对相机行为进行建模,对相机运动和相机内参的相对变化而不是绝对状态进行操作。通过从合成视频数据中学习这种微分公式,我们减轻了对精确的现实世界相机标签的依赖,并能够对焦距、光圈、ISO、色温和镜头畸变等成像因素进行平滑、一致的控制。我们通过两种机制将该框架扩展到现实世界的镜头:微调真实图像元数据对的控制以实现精确的镜头匹配,以及提取解缠结的嵌入以实现隐式视频到视频风格的传输,而不需要显式的相机参数。通过有效地将场景内容与固有成像行为分离,DeltaCam 能够实现相机一致的视频生成和编辑操作,而这是现有模型难以实现的。最终,我们的结果建立了一种实用且可扩展的方法,用于桥接合成控制和现实世界的摄影模拟。