论文

GameReplica:视觉语言代理进行黑盒视觉游戏复制的基准

GameReplica: A Benchmark for Black-Box Visual Game Replication by Vision-Language Agents

智能体系统Agent任务评测

摘要

编码代理基准测试通常在文本、代码或演示中指定目标行为后评估实施情况。现有研究广泛评估了编码代理根据文本规范生成程序的能力。然而,在既没有源代码也没有文档的黑盒条件下,智能体是否可以仅通过视觉观察和主动交互来归纳规则并将目标系统再现为可验证的可执行系统,这一问题仍有待探索。为此,我们提出了GameReplica,一个用于端到端黑盒游戏复制的闭环评估框架,涵盖完整的感知、探索、归纳、再现和验证流程。 GameReplica 包含 125 个任务,涵盖 5 个核心机制系列的 25 个游戏,每个游戏都以五个难度级别进行实例化。这些任务要求代理仅通过屏幕截图和动作界面访问目标游戏,从像素反馈和交互结果中归纳出关键视觉元素和游戏规则,并生成一个独立的、可运行的游戏副本,可以由外部程序自动验证。实验表明,当前的编码代理在端到端黑盒复制方面仍然面临着巨大的挑战:表现最好的模型(Claude Opus 4.8)的总体得分为 71.6\%,而其余模型得分仅为 4.0\%--42.9\%。进一步的分析揭示了所有模型的一致模式:视觉保真度分数远远高于实施和规则一致性分数,表明代理比游戏机制更容易复制视觉外观。难度级别进一步放大了性能差距:从 L1 到 L5,较弱的智能体的总体得分急剧下降,而表现最好的智能体的总体得分仅略有下降。