论文
作者:语言驱动的电影摄影框架,用于以人为中心的视频生成
Auteur: Language-Driven Cinematographic Framing for Human-Centric Video Generation
摘要
生成视频模型已经实现了卓越的视觉保真度和时间连贯性,但有意的摄像机控制仍然难以实现。现有的框架将相机运动视为像素合成的副产品,产生随机的、空间不一致的轨迹,并且与驾驶场景的人类主体无关。在这项工作中,我们提出了 Auteur,一种用于生成视频中语言驱动、以人为中心的相机取景的方法。我们的核心见解是,专业电影制作人不会将镜头设想为世界空间轨迹,而是将其视为相对于演员定义的框架,将镜头大小、角度和构图编码为人体姿势和运动的函数。我们将这种直觉形式化为以人为中心的相机参数化,并引入了可转换为标准 6-DoF 相机参数的领域特定语言 (DSL)。然后,经过微调的多模态 大语言模型 充当虚拟导演,将自然语言描述和粗略的人体运动映射到稀疏 DSL 关键帧,这些关键帧被确定性地插值到连续的摄像机轨迹中,然后作为视频生成器的输入。我们在一个新的数据集上训练和评估 Auteur,该数据集包含 34K 对齐文本、人体运动和 DSL 注释的摄像机轨迹,这些轨迹是从程序合成和来自 CondensedMovies 数据集的真实电影镜头中提取的。 Auteur 能够实现以人为中心的场景的电影摄影框架,这是以前的生成模型中基本上不具备的功能。为了评估这种行为,我们提出了新的以框架为中心的指标,并且我们的实验表明 Auteur 始终优于现有方法。项目页面为 https://cyberiada.github.io/Auteur/