论文

PlayWorld:通过代理玩家对长期目标的世界模型进行基准测试

PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

模型评测基准与评测资源

摘要

视频世界模型根据当前观察和用户操作模拟未来状态。最近的系统在长序列上表现出了令人印象深刻的视频一致性和动作可控性。然而,公平地比较这些交互模型仍然具有挑战性。在实践中,人类玩家通常通过交互追求长期目标来评估世界模型。例如,用户可以旋转360度来查看环境是否保持一致,或者走进水中检查是否产生真实的水波纹。实现相同目标所需的动作序列在模型之间可能有很大差异,使得固定的动作条件评估不适合跨模型比较。为了解决这个问题,我们采用多模式代理玩家与世界模型进行交互,以实现指定的长期目标。在此范例的基础上,我们引入了 PlayWorld,这是一个提供 171 个场景的基准测试,每个场景都有一个特定的目标。为了彻底评估性能,我们从四个核心维度评估模型:几何一致性、交互保真度、视线外演化和洞察演化。此外,我们还纳入了视频质量和可控性的基本能力指标。九个最先进的世界模型的实验表明,当前模型在长期交互​​目标上仍然不可靠,特别是在维持空间一致性和持久状态演化方面。代码和数据可在 https://github.com/kxding/PlayWorld 获取。