论文
FilmBench:电影视频生成的电影级基准
FilmBench: A Film-Grade Benchmark for Cinematic Video Generation
摘要
视频生成方面的进步不断缩小人工智能生成的视频和专业制作的视频之间的视觉差距,但大多数基准测试仍然从网络资源或 LLM 模板中获取提示,并使用未经训练的通用多模式模型对其进行评分。更根本的是,他们的评估分类法仍然很初级(整体视觉质量、粗糙的文本对齐和时间平滑度),而不是实际制作和评判电影的专业电影语言标准,因此他们评估基本视频的合理性而不是电影级的工艺。我们推出 FilmBench,这是一个基于电影学院传统专业电影语言的文本到视频 (T2V) 和参考到视频 (R2V) 基准测试,由北京电影学院和虎景数字传媒娱乐集团电影工作室的导演和教师共同开发。它取决于三个选择。首先,提示是从涵盖 20 个电影类型的获奖电影片段中逆向设计的,并由专业导演选择,因此每个提示都以经过验证的真人参考为基础;提示遵循真实的镜头列表,并且大多数脚本都是多个镜头(1,169 个提示中的 1,056 个是多个镜头),这与之前的单剪辑基准测试不同。其次,评估遵循 3 个轴、12 个组件和 35 个(T2V)+3(仅限 R2V)子指标的三级电影分类法。第三,我们开发了一个内部专家级自动评估代理,并开源了其电影语言运算符(FilmOps)的核心套件。评估器对领先的视频生成模型(T2V 为 9 个,R2V 为 7 个)进行基准测试,重现了模型级别 Spearman \r{ho} = 0.95 (T2V) 和 0.96 (R2V) 的人类模型排名。分数远低于之前的网络风格基准,在动态美学方面存在两个一致的差距,并且单次到多次性能下降明显,对于较弱的模型来说,这种下降会扩大。