论文

视频模型摄像机控制探讨

Probing into Camera Control of Video Models

模型推理解码与生成控制

摘要

视频是丰富且可扩展的 3D/4D 视觉观察来源,而摄像机控制是视频生成模型生成具有几何意义的内容的关键功能。现有方法通常使用额外的相机模块和配对数据来学习从相机运动到视频的映射。然而,此类数据集通常在规模、多样性和场景动态方面受到限制,这可能会使模型偏向于狭窄的输出分布,并损害基础模型学到的强大先验知识。这些限制激发了人们对相机控制的不同看法。在本文中,我们表明相机控制不需要建模为隐式映射问题,而是可以被视为一种引起跨帧位移的几何引导形式。具体来说,我们将相机控制重新表述为一组位移场,并通过在去噪期间对潜在特征进行可微重采样来应用它们。与微调基线相比,我们的简单方法实现了有效的相机控制,并且在不同质量指标上的退化最小。由于我们的方法无需训练即可适用于大多数视频扩散模型,因此它也可以作为研究基础模型的相机控制能力的探针。使用此探针,我们确定了代表性视频模型所共有的普遍偏见,以及它们对摄像机控制的响应的差异。最后,我们对它们在多视图生成中的性能进行了基准测试,深入了解它们在 3D/4D 任务中的潜力。