论文

WorldMark:交互式视频世界模型的统一基准套件

WorldMark: A Unified Benchmark Suite for Interactive Video World Models

模型评测基准与评测资源

摘要

与文本或图像驱动的视频生成不同,交互式世界模型由操作驱动:用户操作,世界做出响应。有两个障碍阻碍了公平和全面的评估。首先,模型以不兼容的格式(场景描述、摄像机轨迹、动作函数)采取动作,因此尚未建立共享协议。其次,虽然现有的基准测试具有先进的世界记忆和视觉质量,但动作跟踪被简化为轨迹或方向错误,这将整个路径压缩为一个数字:而不是世界对命令开关的反应有多快,也不是它沿着命令轴移动的干净程度。 WorldMark 消除了这两个障碍。每个模型的适配器将共享的 WASD 风格词汇转换为每个模型的本机控制格式,因此 10 个异构模型在跨越风格、观点和难度等级的 500 个标准化案例中接收语义相同的指令;一种新型号需要一个适配器。在这个共同点上,我们通过控制系统镜头来表征动作动态——方向准确性、方向纯度、响应延迟和运动稳定性,每个轴都解析——以及世界记忆和视觉质量的套件。它们共同暴露了现有协议无法看到的差异:最快的响应者通常是最不稳定的,这是任何单一行动指标都无法捕获的权衡;每轴分辨率揭示了几乎完美地跟随平移而几乎不响应旋转的模型;具有最佳感知和美学质量的模型在平移方向准确性和延迟方面排名最后;风格化的场景会降低每个模型的全局一致性,同时保持动作动态基本完好。我们将发布所有数据、评估代码和模型输出。