论文
ROWBench:视频模型渲染程序指定的内容吗?
ROWBench: Do Video Models Render What the Program Specifies?
摘要
可编程世界模型将可执行动态与视觉生成分开,为下一代游戏引擎提供了有前景的基础。然而,他们对明确规则和交互的视觉遵守情况仍然没有得到充分评估。现有的基准评估视觉质量、可控性以及指令或身体遵守情况,但很少测试对细粒度、程序指定的世界事件的保真度。我们推出 PROWBench,包括 170 个以编程方式构建的剧集和 600 个代理视频,涵盖不同的场景和交互。 PROWBench 将实体状态和带时间戳的事件(包括相机视野之外的事件)记录为可重播的世界记录,并从中呈现同步视图和代理表示。这使得可以根据程序执行的可观察结果来检查生成的视频。可扩展的框架可以构建场景、控制行为,并可以以不同的表示形式(例如粗略 3D 和边界框)渲染每个摄像机视图。该基准涵盖第一人称和第三人称视角,并可对部分剧集进行同步多视图观察。 PROWBench 以这些记录为基础,评估实体控制、长程内存,并使用两个基于 VLM 的指标(逻辑渲染对齐和交互成功率)、对规定时间线的遵守情况以及带时间戳的引擎记录事件的可视化实现。