论文

PhyGround:生成世界模型中物理推理的基准测试

PhyGround: Benchmarking Physical Reasoning in Generative World Models

模型评测基准与评测资源

摘要

生成世界模型越来越多地用于视频生成,其中学习的模拟器有望捕获控制现实世界动态的物理规则。然而,评估生成的视频是否真正遵循这些规则仍然具有挑战性。现有的以物理为重点的视频基准已经取得了重要进展,但它们仍然面临三个关键挑战,包括隐藏特定规律失败的粗略评估框架、破坏注释判断有效性的响应偏差和疲劳,以及物理意识不足或难以审核的自动评估器。为了应对这些挑战,我们引入了 PhyGround,这是一个基于标准的基准,用于评估视频生成中的物理推理。该基准测试包含 250 个精心设计的提示,每个提示都增加了预期的物理结果,以及涵盖固体力学、流体动力学和光学的 13 条物理定律的分类。每条法律都通过可观察的子问题来实施,以实现每条法律的诊断。我们通过基于社会科学实验室实验设计的大规模、质量控制的人体研究来评估八种现代视频生成模型。共有 459 位标注者提供了 5,796 个完整标注和超过 3.74 万个细粒度标签;质量控制后,保留的注释表现出较高的分半模型排名相关性(Spearman's rho > 0.90)。为了支持可重复的自动评估,我们发布了 PhyJudge-9B,一个开放的物理专业 VLM 判断器。 PhyJudge-9B 的总体相对偏差明显低于 Gemini-3.1-Pro(3.3% vs. 16.6%)。我们在项目页面 https://phyground.github.io/ 上发布提示、人工注释、模型检查点和评估代码。