论文
HappyWorld-长凳
HappyWorld-Bench
摘要
评估世界模型需要评估它们生成的世界的质量以及它们在探索、交互和修改下的一致性和响应能力。我们引入了 HappyWorld-Bench,这是一个综合基准,用于评估生成的世界在智能体与其交互时是否仍然可靠。我们的设计建立在六种世界能力(W1-W6)的分层能力框架之上,从生成构建到统一世界建模,跨三个独立的评估轨道进行实例化:视频世界模型、空间世界模型和具体世界模型。 HappyWorld-Bench 包含 1,138 个视频提示、300 个空间场景和 254 个具体测试用例。在所有三个轨道上,我们构建和运营 HappyWorld-Arena 来组织人类 A/B 比较并得出模型级 Elo 评级,这补充了新设计的捕获行为正确性的自动化指标。我们在这个统一框架下评估了 14 个视频世界模型、9 个空间系统和 8 个具体候选模型。结果揭示了所有三个轨道上仍然存在的可靠性差距:视频模型在扩展部署和重新访问期间表现出一致性降低,空间模型最多实现 70.14% 的放置准确度和 73.33% 的编辑执行,而具体模型则难以在多步骤操作中保持状态并精确响应更改的操作条件和物理规则。这些发现凸显了评估世界模型的必要性,不仅要通过视觉质量,还要通过状态一致性及其对行动和干预措施的反应的正确性。