论文

VGA-Bench:视频美学和生成质量评估的统一基准和多模型框架

VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation

模型评测基准与评测资源

摘要

基于 AIGC 的视频生成的快速发展凸显了对超越传统生成质量指标以涵盖审美吸引力的综合评估框架的迫切需求。然而,现有的基准仍然主要集中在技术保真度上,在整体评估方面存在巨大差距,特别是在感知和艺术品质方面。为了解决这个限制,我们引入了 VGA-Bench,这是一个用于联合评估视频生成质量和美学质量的统一基准。 VGA-Bench 基于原则性的三层分类法:审美质量、审美标签和生成质量,每个分类法都分解为多个细粒度的子维度,以实现系统评估。在此分类法的指导下,我们设计了 1,016 个不同的提示,并使用 12 个视频生成模型生成了超过 60,000 个视频的大规模数据集,确保了内容、风格和工件的广泛覆盖。为了实现可扩展和自动化的评估,我们通过人工标记对数据集的子集进行注释,并开发了三个专用的多任务神经评估器:用于审美质量预测的 VAQA-Net、用于自动审美标记的 VTag-Net 以及用于生成和基本质量属性的 VGQA-Net。大量的实验表明,我们的模型与人类判断实现了可靠的一致,提供了准确性和效率。我们发布 VGA-Bench 作为公共基准,以促进 AIGC 评估研究,以及内容审核、模型调试和生成模型优化方面的应用。