论文

编译式智能体:通用编码智能体从裸交互构建获胜游戏程序

Compiled Agency: Frontier General-Purpose Coding Agents Build Winning Game Players from Bare Interaction - from Flappy Bird to StarCraft II and Civilization

智能体系统Agent任务评测

摘要

大语言模型智能体反复难以把游戏知识转化为胜任的玩法,即使研究者围绕模型提供感知、记忆、技能库、规划器或可执行策略框架也是如此。编码智能体快速进步引出两个更尖锐的问题:前沿模型现在能否赢得游戏,以及能否不受辅助、自行构建整个玩家来获胜?我们提出Gauntlet开发—冻结—评估框架,将小型街机到完整商业规模游戏置于刻意简化的统一契约后:通用编码智能体只得到游戏说明、原始观察与动作接口以及空策略文件,没有策略、算法或架构。在一次自主会话中,智能体试验运行中的游戏并构建独立控制器;随后我们冻结结果,在留出实例上评分,游戏过程中模型调用为零。在未公开的程序生成类Roguelike游戏上,留出成功率为0—86%,并显示鲜明的代际门槛:最新一代系统的每次已观察会话都优于前代最佳会话。在完整游戏规模上,编译得到的原始API控制器击败所有公平模式的《星际争霸II》内置AI和两种作弊变体,单会话程序则在留出随机种子上通过完全征服赢得完整文明类游戏Freeciv。虽然面对新手AI的胜率不高,但这是首次:此前没有语言智能体系统能在没有每轮模型调用和手工战术层的情况下独立赢得这类完整游戏。前沿编码智能体开始能追踪长周期策略,冻结后的程序也可被检查。我们称之为编译式智能体能力:开发经验被编译成持久可执行智能体,其架构由模型构建。

编译式智能体:通用编码智能体从裸交互构建获胜游戏程序:论文配图
图1:在Gauntlet中,智能架构本身是输出。左侧既有工作由研究者预设观察抽象、记忆、技能、规划器、世界模型或优化机制;中间Gauntlet只提供目标、用户可见信息、无策略接口、可执行环境和空策略,由编程智能体自行构建观测工具、分析、状态、记忆、策略与控制器;右侧将独立策略冻结,在不可访问的留出种子或场景上评估,游玩期间不再调用模型,并通过独立新会话测量产物生成系统的可靠性。同一契约跨越私有Roguelike、经典及公开浏览器移植游戏、星际争霸II和Freeciv。