论文

WorldJen:生成视频模型的端到端多维基准

WorldJen: An End-to-End Multi-Dimensional Benchmark for Generative Video Models

模型评测基准与评测资源

摘要

评估生成视频模型仍然是一个悬而未决的问题。结构相似性指数测量 (SSIM) 和峰值信噪比 (PSNR) 等基于参考的指标更注重像素保真度而非语义正确性,而 Frechet 视频距离 (FVD) 则更注重分布纹理而非物理合理性。基于二进制视觉问答 (VQA) 的基准(例如 VBench~2.0)很容易出现“是”偏差,并且依赖于错过时间故障的低分辨率审核员。此外,他们的提示一次针对一个维度,增加了所需的视频数量,但仍然不能保证可靠的结果。 WorldJen 直接解决了这些限制。二进制 VQA 被替换为由 VLM 评分的李克特量表问卷,该 VLM 以原始视频分辨率接收帧。通过使用对抗性策划的提示来解决视频生成成本,这些提示旨在同时执行多达 16 个质量维度。该框架是围绕两个相互关联的贡献构建的。首先,进行了一项盲目的人类偏好研究,积累了(来自 7 个注释者的 2,696 个成对注释,100% 配对覆盖率超过 50 个策划提示 $\times$ 6 个最先进的视频模型。注释者之间的平均一致性达到 66.9%,并且该研究建立了具有三层结构的人类 真值 Bradley-Terry (BT) 评级。 VLM 作为法官评估引擎使用特定提示、特定维度的 Likert 问卷(每个维度 10 个问题,47,160 个评分答案)对视频进行评判并独立重现人类建立的三层 BT 评级结构。VLM 实现了 Spearman $\hatρ=1.000,~p=0.0014$,这被解释为与人类结果的层一致性。六项重点消融研究验证了该结果的稳健性。 VLM评估框架。项目页面:https://moonmath.ai/worldjen/