VGA-BenchV2:用于评估视频美观和生成质量的扩展统一基准和多模型框架
VGA-BenchV2: An Expanded Unified Benchmark and Multi-Model Framework for Evaluating Video Aesthetics and Generation Quality
摘要
我们推出了 VGA-BenchV2,这是一种扩展的人性化基准测试和优化框架,用于共同评估和提高视频生成质量和审美价值。 VGA-BenchV2 基于 VGA-Bench 构建,保留了原始的细粒度分类法,具有两个主要维度(审美和生成)以及 52 个子维度。在此分类法的指导下,我们整理了 1,016 个不同的提示,并收集了 12 个主流视频生成模型生成的 60,000 多个视频。更重要的是,VGA-BenchV2 通过添加 36,000 个任务级注释,大幅扩展了人工标记监督,其中包括 16,200 个用于美学质量的注释、13,200 个用于美学标记的注释和 6,600 个用于生成质量的注释,分别相当于 VGA-Bench 的 13.46 倍、11.15 倍和 1.55 倍放大。利用这个扩大的注释语料库,我们开发了一种混合评估器架构,其中包括用于连续美学评分的 VAQA-Net 和两个基于 Qwen 的大型视觉语言模型评估器 VTag-Net 和 VGQA-Net,用于美学标记和生成质量评估。大量的实验表明,不同的一代模型与人类的判断有很强的一致性。除了评估之外,VGA-BenchV2 还引入了评估到优化的流程,其中学习的美学评估器充当基于强化学习的生成器 微调 的奖励模型。这形成了从基准构建和人工监督到自动评估和模型优化的闭环,使视频生成器不仅能够提高真实感,而且能够提高审美质量和人类偏好一致性。资源可在 https://huggingface.co/datasets/BestiVictoryLab/VGA-Bench 获取。