论文

PlaySuite:交互视觉智能的大规模游戏基准

PlaySuite: A Large-Scale Benchmark for Interactive Visual Intelligence

智能体系统Agent任务评测

摘要

多模态基础模型的最新进展在静态感知和推理基准上产生了强大的性能,但此类评估在很大程度上忽视了智能的一个核心方面:在较长时间范围内的动态环境中胜任行动。我们推出了 PlaySuite,这是一个大规模基准测试,用于评估 PyWeek 和 itch.io 策划的超过 5K 款开源视频游戏的交互式视觉智能。这些独立游戏跨越不同的流派和引擎,包括 Pygame、HTML5、Godot 和 Unity,在很大程度上超出了当前模型的发行范围,降低了通过检索记忆的演练或网络规模的训练工件来取得成功的可能性。为了实现跨异构游戏的可扩展评估,我们开发了一个针对 HPC 集群进行优化的统一闭环交互框架以及一个 Video-LLM-as-a-judge 协议,该协议将可观察的游戏里程碑映射到标准化的进度水平。我们评估了 14 个最新的开放模型,涵盖视觉语言模型、计算机使用智能体和视觉语言动作模型。我们的结果提供了感知与行动差距的有力证据:尽管推理能力很强,但当前的模型难以取得持续进步,并且在空间基础、行动执行和自我纠正方面反复出现失败。 PlaySuite 提供了一个可重复且可扩展的测试平台,用于测量从视觉感知到目标导向交互的进展,并为开发可以在动态视觉环境中行动、适应和泛化的模型奠定了基础。

PlaySuite:交互视觉智能的大规模游戏基准:论文原图
图 2:来自 PlaySuite 游戏语料库的示例。 PlaySuite 包含大量独立开发的游戏,具有不同的视觉风格、机制、摄像机视角和控件。这些示例说明了智能体必须处理的设置范围,从 2D 平台和益智游戏到赛车、探索、射击和 3D 导航环境。