论文

Sci-VBench:评估科学领域的知识和推理密集型视频生成

Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains

模型评测基准与评测资源

摘要

我们推出了 Sci-VBench,这是一个用于评估跨科学领域的知识和推理密集型视频生成的综合基准。它包含 1,253 个专家注释的示例,涵盖四个核心学科的 60 个主题:自然科学、医疗保健、人文与社会科学以及工程。每个示例都需要模型来生成时间丰富的视频,这些视频需要科学推理和基于知识的合成,超越表面视觉的合理性。我们进一步建立了基于标准的评估协议。我们的分析表明,在该协议下,非专家人类评估者和 MLLM-as-Judge 系统都可以与专家判断达成相对较高的一致性,支持大规模的可重复评估。我们对 16 个前沿专有和开源模型进行了基准测试,发现虽然自动感知质量分数在系统中紧密聚集,但提示一致性以及科学和因果正确性的性能差异很大,专有与开源之间存在明显的差距。这些发现表明,视觉现实主义的进步尚未转化为科学和因果动力学的可靠模型。