论文

物理问题场景图:文本到视频生成中物理合理性的细粒度评估

Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation

模型评测评测方法与指标

摘要

视频生成模型越来越能够生成逼真的视频,但它们仍然难以生成遵循基本物理定律的视频。雪上加霜的是,缺乏可靠的精细评估方法来定位和指定视频中违反物理定律的行为。我们通过引入物理问题场景图(PQSG)来解决这个问题,这是一个基于分层问题的评估管道。 PQSG 使用由视觉语言模型 (VLM) 生成的基于图形的问题层次结构,并以高质量的上下文示例为指导,通过检查 忠实性 来评估生成的视频,以了解对象、动作和物理定律的遵守情况。通过将问题表示为图表,PQSG 在问题中引入了逻辑依赖关系,确保每个查询在上下文中都是有效的。此外,PQSG 还可以对视频的哪些质量违反物理合理性约束进行精细评估。我们通过创建 FinePhyEval 来验证 PQSG,该数据集具有基于物理的提示和来自不同最先进视频生成模型(Sora 2、Veo 3 和 Wan 2.1)的相应生成视频,每个视频都由人类在多个类别中进行注释。使用 FinePhyEval,我们测量了 PQSG 的细粒度分数与人类判断之间的相关性,显示出比之前的工作更高的总体相关性。我们还发现 PQSG 在物理真实性方面对闭源模型的排名高于 Wan 2.1。最后,我们表明,我们在 FinePhyEval 中提供的注释也可以用于子任务评估:我们在生成和回答问题方面对两个强大的 VLM 进行了基准测试,发现虽然模型可以创建类似人类的问题,但它们在回答问题方面仍然低于人类的表现。