论文

WorldExam:从外观到内在反应性对世界模型进行基准测试

WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity

模型评测基准与评测资源

摘要

可控视频生成模型越来越多地被开发为世界模型。因此,在这个角色中评估它们超出了生成视频的明显外观,扩展到它们所描绘的世界的固有反应性:从场景状态推断世界应该如何反应并生成输入中未明确描述的合理结果的能力。然而,现有的基准主要通过检查所请求的动作和交互结果是否实现来评估视觉质量或明确的指令履行情况,而没有充分检查固有的反应性。我们推出了 WorldExam,这是一个跨越四个级别的分层诊断基准:视觉质量、控制依从性、空间一致性和世界反应性。它包含 8 个专门任务的 1,474 个案例,并支持对相机、动作和语言驱动的模型范式进行统一评估。世界反应级别评估超出输入中明确指定的场景条件反应和目标导向行为。对 20 个代表性模型的评估揭示了明显的能力分化。相机驱动模型擅长相机控制,但其界面不支持动态交互;行动驱动的模型可以更精确地控制主体,但往往会让世界反应迟钝;语言驱动的模型在交互方面表现更好,但不太忠实地遵循复杂的控制。没有任何模型能够将广泛的任务覆盖范围与始终如一的强大性能相结合,这表明高视觉质量和明确的指令执行并不能保证固有的反应性。