论文

VGI-Bench:探索视频生成模型中的视觉智能

VGI-Bench: Probing Visual Intelligence in Video Generation Models

模型评测基准与评测资源

摘要

最近的研究表明,视频生成模型可以通过生成的帧展示某些形式的零镜头视觉推理。然而,可靠的评估仍然具有挑战性:基准测试应采用与当前视频模型的视觉先验一致的输入,需要有效的演变过程而不仅仅是合理的最终状态,并校准任务难度以保持挑战性但部分可行。为此,我们引入了 VGI-bench,包含 27 个任务和 810 个实例,由任务域和技能标签的两级分类法组织,用于细粒度评估视频生成模型的视觉推理能力。我们的评估表明,当前的生成系统可以解决一部分基于视觉的推理任务,但仍然远不可靠,即使是最强的模型 Seedance 2.0,在我们的评估标准下也只能达到 51.0%。我们的分析进一步探索了输出故障模式、输入条件敏感性、合成 微调 的性能转移边界,以及揭示有限自我校正的内部去噪视角,其中后续步骤主要完善早期假设而不是纠正推理错误。我们希望 VGI-bench 将有助于刺激下一代视频生成模型的开发。网站:https://hexuan21.github.io/VGI-Bench/