论文

V2V-Bench:视频到视频生成评估的综合基准

V2V-Bench: A Comprehensive Benchmark for Video-to-Video Generation Evaluation

模型评测基准与评测资源

摘要

视频到视频 (V2V) 生成很难评估,因为输出必须遵循编辑指令并保留与源视频的帧级对应关系,而现有的 T2V 和 I2V 指标无法捕获这些对应关系。我们引入了 V2V-Bench,这是一个 11 维基准,分为五个类别:时间对齐、结构保真度、转换质量、视频质量和语义对齐。 V2V-Bench 将不同的源视频与具有挑战性的编辑任务配对,并评估了两种商业模型(Grok Imagine 和 Gemini Veo3)以及一种开源模型(Open Sora 2)。结果显示了互补的模型优势:Grok 在编辑保真度方面表现更好,而 Veo3 实现了更强的视觉质量。在六个 V2V 特定维度上,V2V-Bench 与人类判断的 Spearman 相关性达到 0.905。