论文

EvalVerse:专业电影视频生成的管道感知和专家校准基准测试

EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

模型评测评测方法与指标

摘要

生成视频基础模型的快速发展推动了该领域向专业级电影合成方向发展。为了达到如此苛刻的质量,社区转向强化学习 (RL) 和代理工作流程。然而,可靠的评估已成为一个关键瓶颈。现有的基准主要评估“是否正确”(基本的提示跟随),而从根本上忽略了“是否良好”(电影质量、表演和美学)。此外,当前的自动化指标缺乏提供可信信号所需的特定领域的严格性,从而在人类审美感知和机器评分之间造成了严重的可信度差距。为了弥补这一差距,我们引入了 EvalVerse,这是一个全面的、管道感知的、经过专家校准的评估框架。我们不仅将视频生成评估视为一项工程任务,而且将其视为一个核心科学问题:主观电影专业知识的系统数字化。首先,我们将领域知识组织成与专业电影制作工作流程(前期制作、制作和后期制作)相一致的评估分类法。其次,我们将人类专家的判断提炼成具有大规模人类注释的精选数据集。第三,我们通过专家校准的 微调 策略将这些知识注入视觉语言模型 (VLM),使 VLM 能够执行明确的思想链推理。与之前的作品相比,EvalVerse 不仅保留了与基本“正确性”指标的兼容性,而且还显着扩展了“良好性”的标准,并将任务覆盖范围扩大到复杂的多镜头排序和视听集成。因此,通过提供精细的诊断信号,EvalVerse 超越了静态排行榜,并为未来的工作建立了基础设施,例如奖励模型和评估代理。