论文
GameHorizon Suite:游戏中的多视野数据和评估
GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay
摘要
现代视频游戏为人工智能模型提供了一个可测量的测试平台,结合了视觉理解、指令分解、目标规划和多个时间范围内精确动作控制的能力。然而,现有的数据集和基准要么覆盖游戏范围狭窄,缺乏语言说明,要么依赖高方差的在线轨迹采样。为了应对这些挑战,我们推出了 GameHorizon,这是一个统一的数据和评估套件,可以衡量不同模型系列在不同范围内的游戏功能。 GameHorizon Suite 由三个组件组成。首先,GameHorizon-Annotator 是一个用于多水平指令的可扩展且自动化的注释管道。其次,利用该管道,我们构建了 GameHorizon-Data,这是第一个大规模 AAA 游戏数据集,其中包含时间对齐的视频、玩家操作和多水平指令。它包含 100 名人类专家玩家收集的 21 场比赛的 5,000 小时录音。第三,我们构建了具有可重复离线和逐步在线测试的 GameHorizon-Bench。离线轨道使用组织成三个主要任务和一系列诊断变体的数千个标准化问题来实现可重复的评估,而在线轨道测试离线分数是否反映实际的游戏功能,并将失败定位到长期游戏中的特定步骤。基于我们的 GameHorizon Suite,我们通过超过一百万次的模型调用评估了 47 个模型,揭示了任务难度的有意义的层次结构以及模型功能的显着差异。我们的工作可以提供一个标准化的标准来评估跨视野和模型系列的游戏能力。我们将发布我们的数据集、注释器和基准以促进未来的研究。