论文
VideoArgus:视频生成和编辑的基于主体的统一评估
VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing
摘要
评估生成的视频仍然具有挑战性,因为现有基准依赖于固定的评估内容,仅涵盖生成和编辑设置的子集,并为其分数提供有限的证据。我们推出 VideoArgus,这是一个统一的基于标题的框架,涵盖五种视频生成和编辑设置。对于每个输入实例,VideoArgus 都会生成一个输出盲、特定于样本的评分标准,并重用它来评估所有相应的候选视频。该标题定义了具体的标准、评分规则、故障模式和证据计划,指导特定标准的 VLM QA 和可视化工具来生成基于证据的标准分数、基本原理和诊断报告。我们进一步构建了 VideoArgus-Bench,其中包含由 653 个高质量图像和 416 个高质量视频构建的 1,026 个精选输入实例,所有基准评分标准都是预先生成、冻结和发布的。在单独的 1,260 个视频人类对齐集上,VideoArgus 在所有五个任务中实现了比相应的特定基准评估器更高的输入内 Spearman 和 Kendall 与人类判断的相关性。模型排名在不同的标题生成和评估 VLM 主干中也基本保持一致。所有代码和数据均已发布。访问我们的项目页面:https://zzzmyyzeng.github.io/VideoArgus