论文
AI Gamestore:用人类游戏对机器通用智能进行可扩展的开放式评估
AI Gamestore: Scalable, Open-Ended Evaluation of Machine General Intelligence with Human Games
摘要
在技术快速进步的时代,以人类通用智能的广谱为标尺严格评估机器智能日益重要且富有挑战。传统AI基准通常只评估人类活动中有限范围内的狭窄能力。多数基准还是静态的,随着开发者显式或隐式地针对其优化而迅速饱和。我们提出,评估AI系统中类人通用智能的一条更有希望的途径,是一种特别强的通用博弈形式:研究它们如何以及多好地玩并学会玩所有可想象的人类游戏,并与具有相同经验、时间或其他资源水平的人类玩家比较。我们将“人类游戏”定义为人为人设计的游戏,并论证这一由人们能想象并享受的所有此类游戏构成的空间——“人类游戏多元宇宙”(Multiverse of Human Games)——的评估适用性。作为迈向这一愿景的第一步,我们提出AI GameStore,一个可扩展、开放式平台,利用人在回路的LLM合成新的代表性人类游戏,做法是从流行的人类数字游戏平台自动获取并改造标准化、容器化的游戏环境变体。作为概念验证,我们基于Apple App Store与Steam排行榜生成了100款此类游戏,并在短时游戏片段上评估了七个前沿视觉语言模型(VLM)。最佳模型在多数游戏上取得的分数不到人类平均分的10%,尤其在世界模型学习、记忆与规划类游戏上表现吃力。最后我们给出建设AI GameStore的下一步计划,将其作为衡量并推动机器走向类人通用智能的实用途径。