论文
SLVMEval:用于文本到长视频生成的综合元评估基准
SLVMEval: Synthetic Meta Evaluation Benchmark for Text-to-Long Video Generation
摘要
本文提出了合成长视频元评估(SLVMEval),这是元评估文本到视频(T2V)评估系统的基准。拟议的 SLVMEval 基准侧重于在长达 10,486 秒(约 3 小时)的视频上评估这些系统。该基准测试针对一个基本要求,即系统是否能够在人类易于评估的环境中准确评估视频质量。我们采用基于成对比较的元评估框架。基于密集的视频字幕数据集,我们对源视频进行综合降级,以在 10 个不同方面创建受控的“高质量与低质量”对。然后,我们采用众包来过滤和保留那些可以明显感觉到退化的对,从而建立一个有效的最终测试平台。使用这个测试平台,我们评估了现有评估系统对这些对进行排名的可靠性。实验结果表明,人类评估者可以以 84.7%-96.8% 的准确率识别出更好的长视频,而在 10 个方面中的 9 个方面,这些系统的准确度低于人类评估,揭示了文本到长视频评估的弱点。