论文
WorldReasonBench:视频生成器的人性化压力测试作为未来世界状态的预测器
WorldReasonBench: Human-Aligned Stress Testing of Video Generators as Future World-State Predictors
摘要
Seedance2.0和Veo3.1等商业视频生成系统已经迅速改进,强化了视频生成器可能演变成“世界模拟器”的观点。然而,社区仍然缺乏一个基准来直接测试模型是否可以推理观察到的世界应该如何随着时间的推移而演变。我们引入了 WorldReasonBench,它将视频生成评估重新定义为世界状态预测:给定初始状态和动作,模型能否生成状态演化在物理、社会、逻辑和信息上保持一致的未来视频? WorldReasonBench 包含 436 个精选测试用例,带有结构化 真值 QA 注释,涵盖四个推理维度和 22 个子类别。我们使用与人类一致的两部分方法来评估生成的视频:过程感知推理验证使用结构化 QA 和推理阶段诊断来检测时间和因果故障,而多维质量评估对推理质量、时间一致性和视觉美观进行评分,以进行排名和奖励建模。我们进一步介绍了 WorldRewardBench,这是一个偏好基准,包含超过 1.4K 视频的约 6K 个专家注释对,支持成对和逐点奖励模型评估。在现代视频生成器中,我们的结果暴露了视觉合理性和世界推理之间持续存在的差距:视频看起来很有说服力,但动态、因果关系或信息保存却失败了。我们将在 https://github.com/UniX-AI-Lab/WorldReasonBench/ 上发布我们的基准测试和评估工具包,以支持社区对真正的世界感知视频生成的研究。