论文

MSAVBench:对多镜头音频视频生成进行全面、可靠的评估

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

模型评测基准与评测资源

摘要

视频生成正在迅速从单镜头合成发展到复杂的多镜头音频视频 (MSAV) 叙述,以满足现实世界的需求。然而,评估此类前沿模型仍然是一个根本挑战。现有基准的范围和数据多样性有限,并且依赖于严格的评估流程,阻碍了对现代 MSAV 模型的系统和可靠的评估。为了弥补这些差距,我们推出了 MSAVBench,这是第一个用于多镜头音频视频生成的综合基准和自适应混合评估框架。我们的基准测试涵盖视频、音频、镜头和参考这四个关键维度,涵盖不同的任务设置、最多 15 个不同的镜头数量以及具有挑战性的非现实场景。我们的评估框架通过用于镜头分割的自适应自我校正机制、用于主观指标的实例级规则以及用于复杂判断的基于工具的证据提取来提高鲁棒性。此外,MSAVBench 与人类判断高度一致,Spearman 等级相关性达到 91.5%。我们对 19 个最先进的闭源和开源模型的系统评估表明,当前的系统仍然在导演级控制和细粒度视听同步方面遇到困难,而模块化或代理生成管道为缩小开源和闭源模型之间的差距提供了一条有希望的途径。基准数据和评估代码可在 https://github.com/ali-vilab/MSAVBench 上公开获取。